AI News HubLIVE
站內改寫2 分鐘閱讀

OpenAI讓分析便宜了10倍

OpenAI將GPT 5.6 Luna降價80%,使AI輔助分析的成本大幅下降。如今小型模型已具備上一代旗艦模型的智能水平,配合快速分析數據庫,單次AI生成答案的成本可低於半美分。文章建議改用Luna的max effort模式、多問問題、加大評估頻率,並圍繞模型構建詳細的上下文層和低延遲數據平台。

來源Hacker News AI作者: ryguyrg

過去,分析任務往往需要最聰明的AI模型。如今,就連小型模型也已經具備上一代旗艦模型的智能水平,這為agentic analytics(智能體分析)打開了新策略。如果放棄對原始智能的追求,轉而優先考慮速度和成本,用户體驗反而會更好。將現代小型模型與快速的分析數據庫引擎搭配使用,AI和數據庫成本合計,單次AI生成答案的費用可以低於半美分。

本週OpenAI將GPT 5.6 Luna的價格下調了80%,我們的評估很快捕捉到了這一變化,起初甚至以為是出了錯。在agentic SQL基準測試中,max effort模式的Luna取代了低effort模式的Gemini-3-Flash,以5倍更低的價格維持了99.8%的準確率。在語義建模基準測試中,成本又進一步下降,比上週的Luna便宜了10倍;我們判斷模型緩存方面的改進帶來了額外的2倍提升。

Opus 4.5曾讓專業級編碼工作變得真正實用,而GPT 5.6 Luna則在性價比曲線的另一位置帶來了同等量級的改變。Luna擅長SQL,同時又非常快和便宜。在DeepSWE測試中,Luna的得分只比Fable低3%,價格卻不到後者的十分之一。面對這樣的變化,可以先做兩個小調整:如果你過去用大型模型的低effort模式,不妨換成Luna的max effort;同時多問問題。這正是傑文斯悖論——技術越便宜,應用反而越多。比如可以同時驗證5個假設,或者在客户從列表中選擇之前就預取相關答案。

AI變快之後,低延遲數據平台的投資回報率會迅速上升。過去agent請求是總耗時的瓶頸,數據庫快一點也看不出差別。如今Luna這種新模型讓事務型數據庫變成了用户體驗瓶頸。分析型數據庫在處理分析型負載時可能比事務型數據庫快1000倍,而很多agent問題恰好是分析型的。如果分析存儲啓動要30秒,低延遲數據庫在這段時間裏已經能回答10個agent問題。agent工作負載是突發的,因此低延遲serverless方案很有必要。

模型能力再強,也取決於提供給它的上下文。為業務或領域構建詳細的上下文層依然是高槓杆的做法。以前弱模型寫不出準確SQL時,上下文只需要足夠好到讓最強模型理解;現在把領域知識記錄下來,反而能用更弱的模型降低成本、加快響應。數據團隊還需要更多評估。傳統數據質量檢查只驗證約束,比如客户ID不重複、訂單價格非空、外鍵有效;agentic分析任務則需要自然語言問題與基於數據的正確答案,再評估agent能否結合業務上下文和數據庫連接正確回答。這類評估的成本剛剛降低了5倍,因此可以更頻繁地運行,甚至對不同模型、不同參數做測試。評估還能捕捉模型智能波動:性能不僅取決於權重,也取決於服務基礎設施,容量緊張時智能會下降。另外,OpenAI數據團隊也發現,上下文層迴歸的捕捉是評估框架的巨大價值。業務一直在變,新增折扣計劃後agent可能就算錯收入,必須在上報董事會前發現這類邏輯錯誤。

最後,評估工作流應設計成不依賴任何前沿實驗室。我們在自定義測試框架中使用OpenRouter,因此新模型發佈幾小時內就能完成各前沿實驗室模型的測試。把模型視為商品,在測試框架或上下文層建立自己的知識產權,才是現代AI經濟中收益最大的做法。OpenAI和其他實驗室一直在追求讓智能便宜到無需計量;對數據問題來説,GPT 5.6 Luna看起來已經實現了這一目標。接下來要做的是圍繞模型搭建系統:詳盡的文檔化上下文、嚴格的評估和快速的分析引擎,才能把原始智能轉化為對客户的準確、相關答案。