AI News HubLIVE
站内改写3 分钟阅读

Codex崛起,Claude对编程使用进行计量

过去三周,GPT 5.5发布后,AI工程师对Codex的支持增加,而Anthropic调整了Claude的定价策略,为订阅用户提供API信用额度,但被部分用户视为'地毯式撤除'。同时,OpenAI推出企业迁移优惠。文章还涵盖了代理基础设施、模型训练效率、企业AI定价竞争、自主科学与网络安全等多个领域的最新动态。

自GPT 5.5发布以来的三周内,金融界对Anthropic的增长和首席财务官表示青睐,但AI工程师群体中支持Codex的情绪显著上升。这可能是多种因素综合作用的结果:GPT 5.5本身性能出色,Codex的广泛推广,以及更慷慨的使用限制。Anthropic对Claude定价的调整在传达上做得很好,但并非所有使用替代工具的开发者都希望听到:现在每个Claude订阅每月都会获得与订阅金额等值的API令牌积分。例如,支付200美元的用户既享有Claude订阅本身(在Anthropic自有平台如Claude.ai和Claude Code上的交互使用),又获得200美元的API信用额度,可用于其他所有地方(包括claude-p、OpenClaw等程序化使用)。如果一开始就这样,这会被视为一笔很好的交易。然而,由于历史上的补贴和定价优势(估计比API定价低70-90%),人们现在将其视为某种形式的“地毯式撤除”。不过,有了官方政策总比选择性针对OpenClaw、OpenCode以及其他不太受欢迎的工具有所改善。这些新闻与OpenAI同一天推出企业迁移优惠形成了令人难以置信的巧合。最终,我们应谨慎对待任何一方的摇摆——两家实验室都表现良好,这些在宏观上只是正常的定价调整,是正在创造编程未来的人们在颠覆数十年老行业的同时摸索最优定价的过程。Anthropic最初更为宽松,但现在Claude Code已拥有可持续的品牌和作为代理工具的声望,Anthropic正将其最优惠的定价放在自有工具之后,并对其他一切进行计量,而作为挑战者的Codex则对所有方面更加宽松。

在代理基础设施方面,Cline开源了重建的Cline SDK,并更新了CLI,包含TUI、代理团队、定时作业和连接器,将其工具定位为可重复使用的自定义编码代理基板。LangChain在Interrupt上发布了一大批代理生命周期基础设施,包括LangSmith Engine、SmithDB、Sandboxes、Managed Deep Agents、LLM Gateway、Context Hub和Deep Agents 0.6。其中最值得技术关注的是SmithDB,这是一个针对嵌套、长期运行、携带大负载的追踪的专用可观测性数据库,据称在关键工作负载上访问速度快12-15倍;团队表示它构建在Apache DataFusion和Vortex之上。与此同时,Notion的External Agents API允许第三方代理(如Claude、Codex、Cursor、Decagon、Warp和Devin)直接在Notion内部操作,作为共享、可审核的上下文层,而非另一个数据孤岛。Cursor扩展了云代理,提供完全配置的开发环境,包括克隆的仓库、依赖项、版本历史、回滚、作用域出口和隔离的秘密。

在模型训练和架构方面,Nous Research的Token Superposition Training修改了预训练的早期阶段,使模型读取/预测连续的令牌包,然后再恢复到标准的下一令牌预测;他们报告在匹配FLOPs的情况下,壁钟速度提升2-3倍,且推理时无需改变架构,已在270M到3B密集模型和10B-A1B MoE模型上验证。Jonas Geiping等人认为当前基于消息的聊天训练过度将代理限制在单一流中,并发布了一篇多流LLM论文,声称具有更低的延迟、更清晰的关注点分离以及更可读的并行推理/工具使用。δ-mem提出了一种外部在线关联记忆,附加到冻结的全注意力骨干上,8×8状态平均得分提高1.10倍,比非δ-mem基线高1.15倍,在记忆密集型基准上增益更大。NVIDIA的Star Elastic声称一次后训练运行可以衍生出一系列推理模型尺寸,成本比预训练一族模型低360倍,比最先进的压缩方法好7倍。Datology的VLM工作表明,仅数据整理就能在多模态方面产生重大增益:在20个公共VLM基准上平均提升11.7点(2B模型),以约17倍少的训练计算量击败InternVL3.5-2B约10点,并且以3.3倍低的响应FLOPs接近前沿的4B性能。Percy Liang表示下一次Marin运行已经在混合数据中集成了18T令牌,并仍在寻求更多预训练、中期训练和SFT数据。

在企业AI定价和平台竞争方面,Ramp数据显示Anthropic在4月份占企业业务的34.4%,而OpenAI为32.3%,这是首次明显的领先变化。Anthropic同时改变了计划经济:ClaudeDevs宣布付费Claude计划将获得专用的每月程序化使用信用额度,适用于Agent SDK、claude-p、GitHub Actions和第三方SDK应用。这立即被功率用户解读为对订阅补贴工具的重大限制,引发了Theo、Jeremy Howard、Matt Pocock和Omar Sanseviero的批评。Anthropic通过另一项50%的Claude Code每周限额提升(截至7月13日)部分抵消了反弹,叠加此前宣布的2倍5小时限额提升。OpenAI则积极回应,提供两个月免费Codex使用给在30天内迁移的企业客户。OpenAI还发布了更多技术平台细节,包括Windows沙箱设计描述,说明如何结合本地用户、防火墙规则、ACL、写限制令牌、DPAPI和辅助可执行文件来安全运行具有本地文件系统/工具访问权限的编码代理。

在自主科学、网络能力和机器人领域,Recursive公司成立,旨在构建自动化科学并安全自我改进的AI。英国AI安全研究所表示,前沿模型能完成的网络任务长度每几个月翻一番,近期模型正在超越以往趋势。Anthropic/Glasswing的Logan Graham表示Claude Mythos Preview是首个解决AISI端到端网络范围(包括Cooling Tower)的模型,并且是唯一在研究所250万令牌限制下完成所有任务的模型。Figure的Brett Adcock直播了人形机器人使用Helix-02运行完整8小时自主轮班进行包裹分拣的演示,机器人从摄像头像素推理,达到人类水平的速度(约3秒/包裹),进行设备端推理,作为联网舰队协调,自主更换低电量电池,并自我诊断故障转移到维护。这比简短的基准测试片段更清晰地展示了多机器人、长时间、无人在环的编排。