AI News HubLIVE
站內改寫2 分鐘閱讀

OpenAI 釋出 GPT-6 Astra:1.05M 上下文的計算機操作模型,受“嚴重”網路安全門檻約束

OpenAI 於 2026 年 9 月 3 日釋出 GPT-6 Astra,定位是計算機操作模型而不是聊天模型。它在 OSWorld V2-Offline 上達到 72.6%,用可搜尋筆記取代 Codex 的上下文壓縮,提供 105 萬 token 的上下文,輸入/輸出定價為每百萬 token 10/50 美元。它也是 OpenAI 首個達到“嚴重”網路安全門檻的模型,標準訪問渠道會限制漏洞利用等高階網路安全工作。

來源MarkTechPost作者: Asif Razzaq

OpenAI 今日釋出 GPT-6 Astra,稱其為迄今最智慧、對齊度最高的模型,但強調它首先是一套“計算機使用系統”而不是聊天模型。它的目標是以人類操作軟體的方式,在瀏覽器、電子表格、桌面應用和終端中直接完成多步驟任務,而不是隻告訴使用者該怎麼做。Astra 是閉源託管模型,未公開權重,無法自託管;釋出當天只有加入 OpenAI Trusted Access 和 Daybreak 計劃的機構可以使用。

對開發者而言,最重要的變化是上下文處理方式。此前 Codex 使用壓縮機制,當上下文佔滿時會把較早輪次總結成摘要,容易丟失智慧體後續需要的關鍵細節,例如某次修復失敗的原因、已經執行過哪些測試、早期加入的需求是什麼。Astra 改為在多個上下文視窗間保留筆記,並能回搜早期訊息和工具輸出。該功能目前以實驗形式提供,需要修改 config.toml 開啟,未來幾週會成為 Codex 的預設行為。Astra 還能在向使用者提問的同時繼續處理與該問題無關的工作,避免一個未決策事項卡住整個任務。

模型引數方面,Astra 提供 105 萬 token 的上下文視窗、最大 12.8 萬輸出 token,知識截止到 2026 年 4 月 30 日;輸入支援文本和影像,輸出僅文本。reasoning.effort 在 high 之上新增 xhigh 與 max。工具支援包括計算機使用、託管 shell、apply patch、skills、MCP 和工具搜尋,但不支援微調。

基準測試方面,OpenAI 報告 Astra 在 OSWorld V2-Offline 上取得 72.6%,高於 GPT-5.6 Sol 的 65.7%,平均任務耗時也從約 75 分鐘降到約 40 分鐘。Anthropic 稱其 Claude Fable 5.1 達到 77.9%,但同時說明使用的 OSWorld 版本不同,不能直接比較。Astra 在 ARC-AGI-3 上為 98.6%;OpenAI 使用的 Responses API harness 會在輪次之間保留推理,並對長上下文做壓縮,所以該數字反映的是模型加智慧體的組合表現。其他已公佈資料包括:FrontierMath Tier 4 為 97.6%,BenchCAD Vision2Code 為 95.9%(Fable 5.1 為 84.3%),Terminal-Bench Science 為 64.6%(Anthropic 報告 52.6%)。Epoch AI 指出 FrontierMath 由 OpenAI 資助,且其中一部分只有 OpenAI 能訪問。

程式設計能力是相對弱項:Astra 在 DeepSWE v1.1 上為 74.1%,Sol 是 70.8%;Meta 報告 Muse Spark 1.3 在最大推理量下為 75.4%,公開榜單中 Gemini 3.8 Flash 和 Claude Opus 5 也接近 74%。在 113 個任務的測評中,這些差距只相當於一兩個任務。

網路安全能力直接決定訪問模式。Astra 是 OpenAI Preparedness Framework 中首個達到 Critical 網路安全門檻的模型。測試中它能針對加固後的瀏覽器和作業系統開發漏洞利用,並發現兩個此前未知的 V8 漏洞;OpenAI 表示會向維護者披露。實際限制包括:標準訪問渠道會拒絕漏洞利用發現等高階網路安全工作;API 的安全檢查會直接終止任務,而不是暫停等待批准。OpenAI 的 Mia Glaese 提醒,非 Trusted Access 使用者可能遇到速度變慢、暫停甚至被攔截,有時發生在無關任務中。OpenAI 報告 Astra 在 ExploitBench 上為 100%,這是一項能力覆蓋綜合指標而非透過率;在 ExploitGym 上為 42.4%,高於 Sol 的 30.3%,兩項均去掉了通常的六小時時限。

定價方面,Astra 每百萬輸入 token 10 美元、每百萬輸出 token 50 美元,快取輸入每百萬 1 美元;超過 27.2 萬輸入 token 的請求會按整個請求的 2 倍輸入、1.5 倍輸出計費。Batch 和 Flex 打五折,Fast 模式為 2 倍價格;Pro、Business 和 Enterprise 使用者還可使用 Astra Pro。OpenAI 表示 API 與 AWS 將在未來幾天上線。