AI News HubLIVE
站內改寫2 分鐘閱讀

GPT-6 Astra:不到6美元一小時即可僱到的自動化AI工程師

OpenAI今日釋出GPT-6 Astra,這是Stargate計劃中的首款輕量迴圈超級模型,多項基準大幅超越Fable 5.1。作者在消耗超過200億token進行實測後發現,Astra已成為真正自主的AI工程師:能幫你選擇和訓練模型、標註資料、部署除錯系統、管理大量子代理,並能閱讀日誌、處理超長上下文。按實測速度與定價折算,有效執行成本可低於每小時6美元。

OpenAI今天釋出了GPT-6 Astra。它是Stargate計劃中的首款輕量迴圈超級模型,在多項指標上明顯勝過Fable 5.1,包括完全飽和FrontierMath最困難版本(97.6%)以及ARC-AGI-3(99.9%)。釋出會上還有大量常規演示,例如計算機操作、Pokemon、Blender,以及科學和網路安全基準(system card)。Greg表示AGI已經到來,Jakub則表示這正是他想要的“自動化AI研究實習生”。

作者坦承沒有資格評論這些宏大基準,但他們獲得了早期訪問許可權,並儘可能把它投入到各種實際生活與工程任務中。在燒掉超過200億token後,最令人驚訝的發現是:GPT-6 Astra屬於一個新的模型類別——它們本身就是完全有能力的AI工程師。Astra現在能幫助你選擇和訓練模型、標註資料(既能協助你標註,也會像SAM那樣用你的標籤做主動學習)、保持資料處理流水線滿載、埋點並讀取日誌、一次性部署和除錯整套系統、扇出並排程和評估子代理(包括執行其他模型的代理),還能在單個代理執行緒中保持數十億token級別的連貫性。

作者提到,他們此前寫過關於為LLM提高期望值的高回報行為。這次經歷讓他們變得比以往更加雄心勃勃。在過去一個月裡,他們從為一檔有趣的“Kill My SaaS”競賽給人類寫提示詞,發展到構建十幾個內部/個人工具:重做了4個原本需要付費的SaaS工具,徹底重新設計個人網站,做了一個不完整但可用的GitHub與Vercel替代品,為一個合法行動數比圍棋多一萬倍的策略棋盤遊戲訓練遊戲AI,在個人財務整理中節省了數萬美元,還重新出版自己的舊書並配上同步有聲書音訊和實體印刷版。他們表示,後續還有更雄心勃勃的專案即將釋出。

每小時6美元這個數字聽起來可能令人意外,但作者強調這正是他們實測得到的結果——每秒33個token,按每百萬token最高50美元計算。鑑於Astra在token效率上比Sol和Fable更高(Artificial Analysis已獨立確認),如果預覽時延能在正式版中保持,那麼除Spark 1.3之外,Astra通常也是你能買到的最快又最聰明的模型。當然,如果在Ultra上不加限制地全速執行,成本會遠遠超過每小時6美元,因為它太擅長並行處理了。作者展示了Astra自行監控執行、啟停批次、管理大量子代理(各自單獨調參並限制併發)的日誌,並說這基本就是他們願意付費請初級AI工程師做的事情,而作者兩天大約只花了100美元。Astra還能製作模型基準、處理資金、做估算、把執行規模擴大並讓人工參與評分。

作者表示,整體結論是OpenAI顯然已經訓練出了一個能自動化其自身大量AI工程工作的模型。現在是時候學會利用Astra和Fable這一級別的模型,讓自己變得遠比以前“不講道理”。他們同時補充,類似的工作也正在Grok、Fable等前沿模型上展開,但OpenAI此前給予的試用額度最慷慨,因此先有了這篇文章;文中討論的agent編碼模式很可能適用於所有2026年末的前沿模型。