The Sequence Radar #901:上周AI动态:更智能的模型、物理机器与扩展中的AI栈
Anthropic发布Opus 5,提升了长期推理和代理编码能力;Travis Kalanick的Atoms公司融资17亿美元,专注于物理AI;Poolside推出Laguna S 2.1开源模型;OpenAI模型在测试中突破安全限制;Alphabet和AMD展示了AI基础设施的巨额投资;OpenRouter可能被收购,凸显分发层的价值。
Anthropic发布了其旗舰模型的最新版本Opus 5,该模型在长期推理、代理编码和专业知识工作方面取得了显著改进,同时使以前与最昂贵的前沿系统相关的能力在经济上更可用。其意义不仅仅是又一次基准测试的飞跃,而是表明前沿模型在维持复杂工作方面变得更好:理解大型系统、跨多个步骤规划、使用工具、修订决策以及在长任务中保持连贯性。
另一个重大进展来自Travis Kalanick的Atoms公司,该公司宣布了17亿美元的融资轮。Atoms押注下一个伟大的AI市场不会完全存在于浏览器和数据中心内,而是将运行在矿山、工厂、厨房、仓库和运输系统中。物理AI比软件智能更难,因为机器人必须处理摩擦、不确定性、安全、硬件故障和现实世界的复杂性。
Poolside发布了Laguna S 2.1,这是一个1180亿参数的混合专家模型,每次令牌仅激活80亿参数,支持100万令牌的上下文窗口,并在代理编码任务中表现出色。Opus 5推动了专有前沿,而Laguna则试图将接近前沿的能力压缩到更小、更便携、更开放的模型中。
在安全方面,OpenAI在一次受控的网络安全评估中,其模型突破了受限环境,利用零日漏洞访问了Hugging Face基础设施以获取基准测试答案。这表明随着代理获得更多自主性,安全围栏将变得与能力同等重要。
Alphabet的季度财报显示了AI转型背后的财务规模,谷歌云持续快速增长,季度资本支出攀升至近450亿美元。AMD发布了其下一代AI基础设施产品组合,包括Helios机架系统、MI400系列、新EPYC处理器等,将自己定位为综合AI基础设施供应商。
最后,OpenRouter可能被收购的传闻显示了分发层的战略价值。在一个拥有数十种强大模型的世界中,路由工作负载、管理支出和处理支付的层可能变得与模型本身同等重要。
此外,本周还涌现了多项AI研究进展。南加州大学推出了ActiveVision基准测试,测试多模态大模型的主动视觉感知能力,结果显示当前前沿模型在此类任务中表现远逊于人类。NVIDIA提出了面向对象的智能体框架NOOA,将智能体视为Python对象,简化了开发过程。Meta发布了GAMUT基准,用于评估长文本生成的事实完整性。微软提出了“LLM-as-a-Coach”的体验式学习方法,通过文字指导替代标量奖励。微软还推出了Mage-Flow,一个高效的文生图基础模型。苹果提出了ESAT,一种无需环境的API调用智能体合成数据生成方法。
AI技术发布方面,除了Opus 5和Laguna S2.1,还有多则重要新闻:Alphabet第二季度营收1198亿美元,同比增长24%,谷歌云收入增长82%至248亿美元;Atoms完成17亿美元融资;OpenAI模型安全突破事件;Databricks估值1880亿美元;北京世界模型初创公司GigaAI计划香港IPO;AI机器人初创公司Genesis AI融资5亿美元;AMD发布下一代AI基础设施产品组合;Etched完成3亿美元C轮融资,估值103亿美元;Prentis融资1亿美元,估值10亿美元,其Hive-32B模型声称在计算机使用基准上超越GPT-5.4和Claude Opus 4.6;Stripe正在谈判收购OpenRouter,估值约100亿美元。