釋出還不到9小時,OpenAI的GPT-6 Astra就已經創下了3600萬次觀看和16.4萬次點贊,成為自Sora、甚至GPT-4和GPT-5以來最成功的釋出。此前Anthropic在釋出熱度上經常壓過OpenAI,而這一次OpenAI終於扭轉了局面。外界普遍將Astra視為對Anthropic Fable和Opus系列進展的直接回應。
OpenAI官方將Astra稱為“最智慧且最對齊的模型”,強調其在計算機使用、軟體工程、數學與科學推理、辦公文件處理以及網路安全方面的突破。公司表示Astra將首先向有限的組織使用者開放,隨後在幾天內逐步覆蓋ChatGPT Plus、Pro、Business和Enterprise使用者,同時透過API和AWS提供。定價方面,標準版為每100萬輸入token 10美元、每100萬輸出token 50美元;快速版則升至20美元輸入、100美元輸出,速度最高可達2.5倍。OpenAI還公佈了Codex改進、長任務記憶與搜尋上下文、Responses API的非同步函式呼叫等執行時功能。
然而,釋出過程並不順利。使用者遭遇了延遲、部落格文章釋出故障、訪問時間不透明等問題,許多付費使用者不滿於早期體驗者優先獲得訪問權。OpenAI為此為每天未能使用Astra的付費使用者補償了“banked resets”。與此同時,官方釋出的系統卡引起了異常多的關注,因為它一方面描述了更好的對齊表現,另一方面也承認思維鏈的可監測性下降。
OpenAI官方聲稱Astra在ARC-AGI-3上達到99.9%、FrontierMath Tier 4達到98%、ExploitBench達到100%,並稱其比GPT-5.6 Sol在Mind2Web上快1.9倍,還援引了數學界人士關於Astra幫助解決長期開放問題的說法。但獨立評測機構給出了更復雜的圖景。Artificial Analysis的評測顯示,Astra在Coding Agent Index上得分67,與Claude Opus 5和Fable 5大致持平,低於Fable 5.1的70;其token效率比GPT-5.6 Sol高70%,但按最高努力模式計算,由於token單價更高,每任務成本反而貴約75%。在智慧指數上,Astra與GPT-5.6 Sol持平,落後於Claude Fable 5.1和Meta的Muse Spark 1.3。該公司自己的幻覺評測顯示,Astra的幻覺率從92%降至51%,準確率提升了4個百分點,但同時在某些非精選基準上出現了約80 Elo的回退。
ARC Prize和ARC-AGI的評估者則更傾向於強調Astra的突破性。ARC Prize團隊報告,Astra在ARC-AGI-3上的直接得分為63%,但在新的provider adapter harness下可以達到99%;François Chollet測試得到標準harness下66%、連續對話與定製壓縮下接近100%的結果。他也指出,Astra大約在每場遊戲上花費360美元,並且效率很高,能在96%的已完賽關卡中使用比人類中位數更少的動作。ARC-AGI-3在約6個月內從不到1%提升到接近完全飽和,Chollet因此確認ARC-AGI-4將在2027年第一季度推出。
在更廣泛的AI社群中,討論迅速分化為幾個陣營。正面評價主要集中在Astra的計算機使用、3D生成與重建、遊戲構建、長時間知識工作和形式化科學推理上;負面評價則聚焦於可監測性下降、評測感知、釋出治理、基準飽和,以及“對齊進步可能只是掩蓋具體失敗模式”的擔憂。OpenAI為應對安全隱憂,還宣佈為防禦方和關鍵基礎設施提供10億美元的Daybreak補貼或訪問承諾。
這次釋出還放大了幾個長期趨勢:基準測試正以比基準文化更新更快的速度飽和;前沿能力正從單純的聊天和程式碼擴充套件到計算機操作、多模態空間推理、長週期智慧體規劃、形式定理證明和網路安全;安全評估的重點正從拒絕率和對齊率轉向隱藏推理下的可監測性和可控性。成本討論也不再看每token價格,而是看每任務成本或達到目標分數所需成本。圍繞“AGI”的論爭進一步分裂:有人將Astra的能力視為AGI的佐證,有人則認為這會帶來重大經濟變革,還有人強調問題的關鍵不在於是否達到AGI,而在於大規模部署時模型是否可控、可監測。