AI News HubLIVE
站内改写2 分钟阅读

OpenAI让分析便宜了10倍

OpenAI将GPT 5.6 Luna降价80%,使AI辅助分析的成本大幅下降。如今小型模型已具备上一代旗舰模型的智能水平,配合快速分析数据库,单次AI生成答案的成本可低于半美分。文章建议改用Luna的max effort模式、多问问题、加大评估频率,并围绕模型构建详细的上下文层和低延迟数据平台。

来源Hacker News AI作者: ryguyrg

过去,分析任务往往需要最聪明的AI模型。如今,就连小型模型也已经具备上一代旗舰模型的智能水平,这为agentic analytics(智能体分析)打开了新策略。如果放弃对原始智能的追求,转而优先考虑速度和成本,用户体验反而会更好。将现代小型模型与快速的分析数据库引擎搭配使用,AI和数据库成本合计,单次AI生成答案的费用可以低于半美分。

本周OpenAI将GPT 5.6 Luna的价格下调了80%,我们的评估很快捕捉到了这一变化,起初甚至以为是出了错。在agentic SQL基准测试中,max effort模式的Luna取代了低effort模式的Gemini-3-Flash,以5倍更低的价格维持了99.8%的准确率。在语义建模基准测试中,成本又进一步下降,比上周的Luna便宜了10倍;我们判断模型缓存方面的改进带来了额外的2倍提升。

Opus 4.5曾让专业级编码工作变得真正实用,而GPT 5.6 Luna则在性价比曲线的另一位置带来了同等量级的改变。Luna擅长SQL,同时又非常快和便宜。在DeepSWE测试中,Luna的得分只比Fable低3%,价格却不到后者的十分之一。面对这样的变化,可以先做两个小调整:如果你过去用大型模型的低effort模式,不妨换成Luna的max effort;同时多问问题。这正是杰文斯悖论——技术越便宜,应用反而越多。比如可以同时验证5个假设,或者在客户从列表中选择之前就预取相关答案。

AI变快之后,低延迟数据平台的投资回报率会迅速上升。过去agent请求是总耗时的瓶颈,数据库快一点也看不出差别。如今Luna这种新模型让事务型数据库变成了用户体验瓶颈。分析型数据库在处理分析型负载时可能比事务型数据库快1000倍,而很多agent问题恰好是分析型的。如果分析存储启动要30秒,低延迟数据库在这段时间里已经能回答10个agent问题。agent工作负载是突发的,因此低延迟serverless方案很有必要。

模型能力再强,也取决于提供给它的上下文。为业务或领域构建详细的上下文层依然是高杠杆的做法。以前弱模型写不出准确SQL时,上下文只需要足够好到让最强模型理解;现在把领域知识记录下来,反而能用更弱的模型降低成本、加快响应。数据团队还需要更多评估。传统数据质量检查只验证约束,比如客户ID不重复、订单价格非空、外键有效;agentic分析任务则需要自然语言问题与基于数据的正确答案,再评估agent能否结合业务上下文和数据库连接正确回答。这类评估的成本刚刚降低了5倍,因此可以更频繁地运行,甚至对不同模型、不同参数做测试。评估还能捕捉模型智能波动:性能不仅取决于权重,也取决于服务基础设施,容量紧张时智能会下降。另外,OpenAI数据团队也发现,上下文层回归的捕捉是评估框架的巨大价值。业务一直在变,新增折扣计划后agent可能就算错收入,必须在上报董事会前发现这类逻辑错误。

最后,评估工作流应设计成不依赖任何前沿实验室。我们在自定义测试框架中使用OpenRouter,因此新模型发布几小时内就能完成各前沿实验室模型的测试。把模型视为商品,在测试框架或上下文层建立自己的知识产权,才是现代AI经济中收益最大的做法。OpenAI和其他实验室一直在追求让智能便宜到无需计量;对数据问题来说,GPT 5.6 Luna看起来已经实现了这一目标。接下来要做的是围绕模型搭建系统:详尽的文档化上下文、严格的评估和快速的分析引擎,才能把原始智能转化为对客户的准确、相关答案。