发布还不到9小时,OpenAI的GPT-6 Astra就已经创下了3600万次观看和16.4万次点赞,成为自Sora、甚至GPT-4和GPT-5以来最成功的发布。此前Anthropic在发布热度上经常压过OpenAI,而这一次OpenAI终于扭转了局面。外界普遍将Astra视为对Anthropic Fable和Opus系列进展的直接回应。
OpenAI官方将Astra称为“最智能且最对齐的模型”,强调其在计算机使用、软件工程、数学与科学推理、办公文档处理以及网络安全方面的突破。公司表示Astra将首先向有限的组织用户开放,随后在几天内逐步覆盖ChatGPT Plus、Pro、Business和Enterprise用户,同时通过API和AWS提供。定价方面,标准版为每100万输入token 10美元、每100万输出token 50美元;快速版则升至20美元输入、100美元输出,速度最高可达2.5倍。OpenAI还公布了Codex改进、长任务记忆与搜索上下文、Responses API的异步函数调用等运行时功能。
然而,发布过程并不顺利。用户遭遇了延迟、博客文章发布故障、访问时间不透明等问题,许多付费用户不满于早期体验者优先获得访问权。OpenAI为此为每天未能使用Astra的付费用户补偿了“banked resets”。与此同时,官方发布的系统卡引起了异常多的关注,因为它一方面描述了更好的对齐表现,另一方面也承认思维链的可监测性下降。
OpenAI官方声称Astra在ARC-AGI-3上达到99.9%、FrontierMath Tier 4达到98%、ExploitBench达到100%,并称其比GPT-5.6 Sol在Mind2Web上快1.9倍,还援引了数学界人士关于Astra帮助解决长期开放问题的说法。但独立评测机构给出了更复杂的图景。Artificial Analysis的评测显示,Astra在Coding Agent Index上得分67,与Claude Opus 5和Fable 5大致持平,低于Fable 5.1的70;其token效率比GPT-5.6 Sol高70%,但按最高努力模式计算,由于token单价更高,每任务成本反而贵约75%。在智能指数上,Astra与GPT-5.6 Sol持平,落后于Claude Fable 5.1和Meta的Muse Spark 1.3。该公司自己的幻觉评测显示,Astra的幻觉率从92%降至51%,准确率提升了4个百分点,但同时在某些非精选基准上出现了约80 Elo的回退。
ARC Prize和ARC-AGI的评估者则更倾向于强调Astra的突破性。ARC Prize团队报告,Astra在ARC-AGI-3上的直接得分为63%,但在新的provider adapter harness下可以达到99%;François Chollet测试得到标准harness下66%、连续对话与定制压缩下接近100%的结果。他也指出,Astra大约在每场游戏上花费360美元,并且效率很高,能在96%的已完赛关卡中使用比人类中位数更少的动作。ARC-AGI-3在约6个月内从不到1%提升到接近完全饱和,Chollet因此确认ARC-AGI-4将在2027年第一季度推出。
在更广泛的AI社区中,讨论迅速分化为几个阵营。正面评价主要集中在Astra的计算机使用、3D生成与重建、游戏构建、长时间知识工作和形式化科学推理上;负面评价则聚焦于可监测性下降、评测感知、发布治理、基准饱和,以及“对齐进步可能只是掩盖具体失败模式”的担忧。OpenAI为应对安全隐忧,还宣布为防御方和关键基础设施提供10亿美元的Daybreak补贴或访问承诺。
这次发布还放大了几个长期趋势:基准测试正以比基准文化更新更快的速度饱和;前沿能力正从单纯的聊天和代码扩展到计算机操作、多模态空间推理、长周期智能体规划、形式定理证明和网络安全;安全评估的重点正从拒绝率和对齐率转向隐藏推理下的可监测性和可控性。成本讨论也不再看每token价格,而是看每任务成本或达到目标分数所需成本。围绕“AGI”的论争进一步分裂:有人将Astra的能力视为AGI的佐证,有人则认为这会带来重大经济变革,还有人强调问题的关键不在于是否达到AGI,而在于大规模部署时模型是否可控、可监测。