在 Amazon Bedrock 上開始使用 OpenAI GPT-5.6 Sol、Terra 和 Luna
OpenAI GPT-5.6 Sol、Terra 和 Luna 現已普遍可用,可通過 Amazon Bedrock 上的 bedrock-mantle 端點訪問。本文介紹瞭如何選擇模型、使用 Responses API 進行推理、通過提示緩存降低成本、連接 OpenAI Codex 編碼代理以及規劃配額和擴展。
OpenAI GPT-5.6 系列模型——Sol、Terra 和 Luna——現已通過 Amazon Bedrock 正式上線,開發者可以通過熟悉的 OpenAI Responses API 調用這些前沿模型,而無需管理單獨的模型基礎設施。這些模型覆蓋從自主編碼代理、長時推理到高吞吐、低延遲推理的各種工作負載,並享受 AWS 的安全、區域處理和成本控制優勢。
所有三個模型均可通過 bedrock-mantle 端點上的 Responses API 訪問。Sol 是旗艦推理模型,Terra 平衡性能和成本,適用於日常生產工作,而 Luna 則針對快速、低成本推理進行了優化。定價與 OpenAI 首方價格一致,使用量計入現有 AWS 承諾。
模型規格概覽:Sol 適用於自主編碼、安全研究、科學分析和深度多步推理,目前在美國東部(弗吉尼亞北部)和俄亥俄區域可用。Terra 適用於通用生產工作負載,在上述區域及美國西部(俄勒岡)可用。Luna 則面向分類、摘要和路由等高吞吐、延遲敏感型任務,區域覆蓋與 Terra 相同。所有模型均支持文本和圖像輸入、文本輸出、272K token 上下文窗口,以及從 none 到 max 的推理努力級別。
要開始使用,您需要一個擁有 bedrock-mantle 端點推理權限的 AWS 賬號。建議附加 AmazonBedrockMantleInferenceAccess 託管策略。安裝 OpenAI Python SDK 2.45.0 或更高版本,並通過自動刷新的短期密鑰或環境變量進行身份驗證。自動刷新方式使用 BedrockOpenAI 客户端和 token 提供程序;環境變量方式設置 AWS_BEARER_TOKEN_BEDROCK 並手動傳遞。
運行首次推理時,您只需指定模型 ID(如 openai.gpt-5.6-terra)、輸入和最大輸出 token 數,即可通過 Responses API 獲得文本輸出。如需控制推理努力,可設置 reasoning.effort 參數。例如,對於複雜數學問題,可選擇 high 級別獲得更準確的結果。
工具調用是 GPT-5.6 的核心功能。您需要將模型輸出中的推理項包含在下一輪輸入中,並在客户端實現函數調用循環。這使模型能夠請求外部數據並完成多步任務。生產環境中建議搭配 Amazon Bedrock Guardrails 使用。
控制台體驗已針對新一代推理引擎進行優化。您可以通過創建項目、分配模型、配置 API 密鑰並排評估模型。在模型目錄中,您最多可同時比較三個模型,涵蓋 GPT、Claude 和開放權重模型。
提示緩存是降低成本的關鍵技術。隱式緩存默認啓用,無需代碼更改。顯式緩存允許您通過緩存斷點精確控制緩存內容。緩存輸入享受 90% 折扣,緩存寫入按 1.25 倍計費。每個斷點要求前綴至少 1024 token,每次請求最多 4 個檢查點。緩存有效期為至少 30 分鐘。通過設置一致的 prompt_cache_key 可提高匹配可靠性。例如,將系統指令緩存,用户問題置於斷點之後,可大幅降低重複請求的成本。
總之,GPT-5.6 系列在 Amazon Bedrock 上為開發者提供了強大的 AI 能力,結合 AWS 的安全性與可擴展性,能夠滿足從複雜推理到高吞吐生產環境的多樣化需求。