AI News HubLIVE
站內改寫2 分鐘閱讀

OpenAI讓分析便宜了10倍

OpenAI將GPT 5.6 Luna降價80%,使AI輔助分析的成本大幅下降。如今小型模型已具備上一代旗艦模型的智慧水平,配合快速分析資料庫,單次AI生成答案的成本可低於半美分。文章建議改用Luna的max effort模式、多問問題、加大評估頻率,並圍繞模型構建詳細的上下文層和低延遲資料平臺。

來源Hacker News AI作者: ryguyrg

過去,分析任務往往需要最聰明的AI模型。如今,就連小型模型也已經具備上一代旗艦模型的智慧水平,這為agentic analytics(智慧體分析)開啟了新策略。如果放棄對原始智慧的追求,轉而優先考慮速度和成本,使用者體驗反而會更好。將現代小型模型與快速的分析資料庫引擎搭配使用,AI和資料庫成本合計,單次AI生成答案的費用可以低於半美分。

本週OpenAI將GPT 5.6 Luna的價格下調了80%,我們的評估很快捕捉到了這一變化,起初甚至以為是出了錯。在agentic SQL基準測試中,max effort模式的Luna取代了低effort模式的Gemini-3-Flash,以5倍更低的價格維持了99.8%的準確率。在語義建模基準測試中,成本又進一步下降,比上週的Luna便宜了10倍;我們判斷模型快取方面的改進帶來了額外的2倍提升。

Opus 4.5曾讓專業級編碼工作變得真正實用,而GPT 5.6 Luna則在價效比曲線的另一位置帶來了同等量級的改變。Luna擅長SQL,同時又非常快和便宜。在DeepSWE測試中,Luna的得分只比Fable低3%,價格卻不到後者的十分之一。面對這樣的變化,可以先做兩個小調整:如果你過去用大型模型的低effort模式,不妨換成Luna的max effort;同時多問問題。這正是傑文斯悖論——技術越便宜,應用反而越多。比如可以同時驗證5個假設,或者在客戶從列表中選擇之前就預取相關答案。

AI變快之後,低延遲資料平臺的投資回報率會迅速上升。過去agent請求是總耗時的瓶頸,資料庫快一點也看不出差別。如今Luna這種新模型讓事務型資料庫變成了使用者體驗瓶頸。分析型資料庫在處理分析型負載時可能比事務型資料庫快1000倍,而很多agent問題恰好是分析型的。如果分析儲存啟動要30秒,低延遲資料庫在這段時間裡已經能回答10個agent問題。agent工作負載是突發的,因此低延遲serverless方案很有必要。

模型能力再強,也取決於提供給它的上下文。為業務或領域構建詳細的上下文層依然是高槓杆的做法。以前弱模型寫不出準確SQL時,上下文只需要足夠好到讓最強模型理解;現在把領域知識記錄下來,反而能用更弱的模型降低成本、加快響應。資料團隊還需要更多評估。傳統資料質量檢查只驗證約束,比如客戶ID不重複、訂單價格非空、外部索引鍵有效;agentic分析任務則需要自然語言問題與基於資料的正確答案,再評估agent能否結合業務上下文和資料庫連線正確回答。這類評估的成本剛剛降低了5倍,因此可以更頻繁地執行,甚至對不同模型、不同引數做測試。評估還能捕捉模型智慧波動:效能不僅取決於權重,也取決於服務基礎設施,容量緊張時智慧會下降。另外,OpenAI資料團隊也發現,上下文層迴歸的捕捉是評估框架的巨大價值。業務一直在變,新增折扣計劃後agent可能就算錯收入,必須在上報董事會前發現這類邏輯錯誤。

最後,評估工作流應設計成不依賴任何前沿實驗室。我們在自定義測試框架中使用OpenRouter,因此新模型釋出幾小時內就能完成各前沿實驗室模型的測試。把模型視為商品,在測試框架或上下文層建立自己的智慧財產權,才是現代AI經濟中收益最大的做法。OpenAI和其他實驗室一直在追求讓智慧便宜到無需計量;對資料問題來說,GPT 5.6 Luna看起來已經實現了這一目標。接下來要做的是圍繞模型搭建系統:詳盡的文件化上下文、嚴格的評估和快速的分析引擎,才能把原始智慧轉化為對客戶的準確、相關答案。