GPT-6 Astra:不到6美元一小时即可雇到的自动化AI工程师
OpenAI今日发布GPT-6 Astra,这是Stargate计划中的首款轻量循环超级模型,多项基准大幅超越Fable 5.1。作者在消耗超过200亿token进行实测后发现,Astra已成为真正自主的AI工程师:能帮你选择和训练模型、标注数据、部署调试系统、管理大量子代理,并能阅读日志、处理超长上下文。按实测速度与定价折算,有效运行成本可低于每小时6美元。
OpenAI今天发布了GPT-6 Astra。它是Stargate计划中的首款轻量循环超级模型,在多项指标上明显胜过Fable 5.1,包括完全饱和FrontierMath最困难版本(97.6%)以及ARC-AGI-3(99.9%)。发布会上还有大量常规演示,例如计算机操作、Pokemon、Blender,以及科学和网络安全基准(system card)。Greg表示AGI已经到来,Jakub则表示这正是他想要的“自动化AI研究实习生”。
作者坦承没有资格评论这些宏大基准,但他们获得了早期访问权限,并尽可能把它投入到各种实际生活与工程任务中。在烧掉超过200亿token后,最令人惊讶的发现是:GPT-6 Astra属于一个新的模型类别——它们本身就是完全有能力的AI工程师。Astra现在能帮助你选择和训练模型、标注数据(既能协助你标注,也会像SAM那样用你的标签做主动学习)、保持数据处理流水线满载、埋点并读取日志、一次性部署和调试整套系统、扇出并调度和评估子代理(包括运行其他模型的代理),还能在单个代理线程中保持数十亿token级别的连贯性。
作者提到,他们此前写过关于为LLM提高期望值的高回报行为。这次经历让他们变得比以往更加雄心勃勃。在过去一个月里,他们从为一档有趣的“Kill My SaaS”竞赛给人类写提示词,发展到构建十几个内部/个人工具:重做了4个原本需要付费的SaaS工具,彻底重新设计个人网站,做了一个不完整但可用的GitHub与Vercel替代品,为一个合法行动数比围棋多一万倍的策略棋盘游戏训练游戏AI,在个人财务整理中节省了数万美元,还重新出版自己的旧书并配上同步有声书音频和实体印刷版。他们表示,后续还有更雄心勃勃的项目即将发布。
每小时6美元这个数字听起来可能令人意外,但作者强调这正是他们实测得到的结果——每秒33个token,按每百万token最高50美元计算。鉴于Astra在token效率上比Sol和Fable更高(Artificial Analysis已独立确认),如果预览时延能在正式版中保持,那么除Spark 1.3之外,Astra通常也是你能买到的最快又最聪明的模型。当然,如果在Ultra上不加限制地全速运行,成本会远远超过每小时6美元,因为它太擅长并行处理了。作者展示了Astra自行监控运行、启停批次、管理大量子代理(各自单独调参并限制并发)的日志,并说这基本就是他们愿意付费请初级AI工程师做的事情,而作者两天大约只花了100美元。Astra还能制作模型基准、处理资金、做估算、把运行规模扩大并让人工参与评分。
作者表示,整体结论是OpenAI显然已经训练出了一个能自动化其自身大量AI工程工作的模型。现在是时候学会利用Astra和Fable这一级别的模型,让自己变得远比以前“不讲道理”。他们同时补充,类似的工作也正在Grok、Fable等前沿模型上展开,但OpenAI此前给予的试用额度最慷慨,因此先有了这篇文章;文中讨论的agent编码模式很可能适用于所有2026年末的前沿模型。