阿里通义发布Qwen-CUA原生电脑操作代理
Qwen-CUA基于397B混合专家模型,仅通过截图和键鼠事件操作软件。在OSWorld-Verified基准测试中得分86.2,优于Qwen3.7并媲美领先专有系统。
开发者可关注其无需DOM树或API即可操作软件的通用接口能力,评估其在长 horizon 任务中的自动化潜力及集成可行性。
- 基于397B-A17B Qwen混合专家骨干网络
- OSWorld-Verified得分为86.2
- RedTeamCUA攻击成功率降至16.4
阿里、英伟达等发布AI代理与架构新进展,聚焦电脑操作、存储优化及模型自进化能力提升。
按分类过滤;排序保持编辑选择,不按点击量重新排列。
Qwen-CUA基于397B混合专家模型,仅通过截图和键鼠事件操作软件。在OSWorld-Verified基准测试中得分86.2,优于Qwen3.7并媲美领先专有系统。
开发者可关注其无需DOM树或API即可操作软件的通用接口能力,评估其在长 horizon 任务中的自动化潜力及集成可行性。
英伟达发布Alpamayo 2 Super自动驾驶推理模型,支持长尾场景处理并基于OpenMDW-1.1协议开放商用。该模型允许开发者进行微调及商业再分发,旨在提升自动驾驶系统的安全性与透明度。
开发者可利用其宽松许可将模型适配至专有数据与车队策略中,在保留数据控制权的同时加速自动驾驶应用的商业化落地。
NVIDIA在FMS会议上展示新存储进展,强调存储需从被动转为主动以支持AI工厂。其Vera CPU在压缩加密流水线中吞吐量比x86 CPU高3.21倍。
开发者需关注存储架构升级,利用GPU直接发起存储请求的能力优化数据路径,解决AI代理并发访问导致的瓶颈。
GitHub Copilot云代理现允许用户在任务开始时为支持的模型设置推理层级。高层级推理能提升复杂问题解答质量,但会消耗更多Token和积分。
开发者可根据任务复杂度权衡回答质量与成本,在Copilot Pro及企业版等付费计划中调整配置以优化支出。
GitHub Copilot新增功能,允许在创建Issue或PR评论时触发云代理自动化。用户可指定特定评论文本作为触发条件,适用于Pro至Enterprise各层级用户。
开发者可利用此功能构建基于代码审查反馈的自动响应工作流,提升协作效率。建议检查仓库Agents设置并配置常用评论触发规则。
Ollama发布v0.32.6版本,MLX引擎利用MTP头实现Qwen3.5在Apple GPU上的自动投机解码。聊天补全流式响应现在匹配OpenAI的线路格式,并修复了截断响应的finish_reason报告问题。
开发者需更新以获取Apple硬件上的推理加速及更标准的OpenAI API兼容性。注意实验性图像生成功能已被移除,如需该功能应回退至v0.32.5版本。
LLM 0.32版本新增可见推理追踪、服务端工具支持及重新设计的日志系统。默认模型更新为GPT-5.6 Luna,并配套更新了Anthropic等插件以支持Web搜索和代码执行。
开发者可利用新特性调试推理模型思维过程,并通过服务端工具增强CLI交互能力,建议升级以体验更高效的本地LLM工作流。
RoMeRL通过降阶效用状态表示,解决自进化LLM Agent中反馈分散和无关经验误导更新的问题。该方法在ALFWorld等基准测试中显著提升了任务性能并降低了资源消耗。
开发者可参考该研究优化Agent长期记忆系统,利用开源代码实现更高效的反馈集中与内存管理,减少LLM调用成本。
GROVE是一个无需训练的框架,通过因果方式从连续视频流中构建分层记忆,支持细粒度感知证据的存储与检索。它在MM-lifelong和EgoServe等基准测试中取得了最佳结果,统一了反应式问答和主动辅助的记忆访问接口。
开发者可利用其开源代码实现高效的视频记忆系统,无需额外训练即可处理长期视觉历史数据,适用于可穿戴设备开发。
提出CoPES协同参数子空间进化策略,将全参数空间分解为低维子空间协同搜索。在Qwen3.5-4B数学任务中,其理论显存需求不到GRPO的八分之一,并恢复了92%的精度增益。
为资源受限场景提供无需反向传播的高效后训练方案,开发者可利用开源代码降低智能体微调的硬件门槛。
HarMoE提出一种数据集感知混合专家框架,通过统一疾病词汇表整合多源标注数据,解决异构数据集导致的语义纠缠问题。该方法在零样本分类和分布外迁移任务上均优于现有基线,并计划开源代码及87.3万规模的和谐化数据集。
开发者可利用即将开源的代码和数据集,构建更鲁棒的放射科视觉语言模型,摆脱对单一MIMIC-CXR数据源的依赖,提升模型在多种病理覆盖下的泛化能力。
该研究提出SPEE统一后训练框架,结合显式经验演化与隐式策略优化,解决现有自改进范式碎片化问题。在五个数学推理基准测试中,SPEE在三种模型规模下均优于测试时和训练时基线。
开发者可参考其经验蒸馏机制优化模型后训练流程,或直接使用开源代码复现自改进能力以提升模型推理性能。
AURORA-LM提出一种分离文本表示构建与分布建模的连续潜在扩散语言模型。该模型在OpenWebText生成和XSum摘要任务中表现优于现有同类模型,并在昇腾NPU上完成实验。
研究者需关注其将文本映射到高容量可解码潜在空间的方法,这为突破离散token限制提供了新路径。开发者可参考其基于流匹配的块因果扩散Transformer设计,以优化生成效率。
GPT-Live通过无轮次语音模型和低延迟架构,实现了与AI的连续语音交互。该系统旨在提供更快速、更自然的对话体验。
为开发者构建低延迟实时语音应用提供了架构参考,有助于优化自然对话体验。
英伟达参与美国国家科学基金会启动的州和区域人工智能基础设施中心计划。该计划旨在通过公私合作扩大全美高校及研究机构的AI算力、软件和教育资源访问权限。
开发者与研究者可关注所在区域是否纳入该枢纽网络,以获取更便捷的AI计算资源与技术支援。高校团队可利用此机会申请加入联合体,降低构建AI科研基础设施的成本与门槛。
这个分类今天没有入选条目。
一天一封,只发当日简报和重要更新。不做二次营销,退订由 Buttondown 直接处理。
订阅名单不会存进本站;正式开放后由 Buttondown 托管确认与退订。