在 Amazon Bedrock 上開始使用 OpenAI GPT-5.6 Sol、Terra 和 Luna
OpenAI GPT-5.6 Sol、Terra 和 Luna 現已普遍可用,可透過 Amazon Bedrock 上的 bedrock-mantle 端點訪問。本文介紹瞭如何選擇模型、使用 Responses API 進行推理、透過提示快取降低成本、連線 OpenAI Codex 編碼代理以及規劃配額和擴充套件。
OpenAI GPT-5.6 系列模型——Sol、Terra 和 Luna——現已透過 Amazon Bedrock 正式上線,開發者可以透過熟悉的 OpenAI Responses API 呼叫這些前沿模型,而無需管理單獨的模型基礎設施。這些模型覆蓋從自主編碼代理、長時推理到高吞吐、低延遲推理的各種工作負載,並享受 AWS 的安全、區域處理和成本控制優勢。
所有三個模型均可透過 bedrock-mantle 端點上的 Responses API 訪問。Sol 是旗艦推理模型,Terra 平衡效能和成本,適用於日常生產工作,而 Luna 則針對快速、低成本推理進行了最佳化。定價與 OpenAI 首方價格一致,使用量計入現有 AWS 承諾。
模型規格概覽:Sol 適用於自主編碼、安全研究、科學分析和深度多步推理,目前在美國東部(弗吉尼亞北部)和俄亥俄區域可用。Terra 適用於通用生產工作負載,在上述區域及美國西部(俄勒岡)可用。Luna 則面向分類、摘要和路由等高吞吐、延遲敏感型任務,區域覆蓋與 Terra 相同。所有模型均支援文本和影像輸入、文本輸出、272K token 上下文視窗,以及從 none 到 max 的推理努力級別。
要開始使用,您需要一個擁有 bedrock-mantle 端點推理許可權的 AWS 賬號。建議附加 AmazonBedrockMantleInferenceAccess 託管策略。安裝 OpenAI Python SDK 2.45.0 或更高版本,並透過自動重新整理的短期金鑰或環境變數進行身份驗證。自動重新整理方式使用 BedrockOpenAI 客戶端和 token 提供程式;環境變數方式設定 AWS_BEARER_TOKEN_BEDROCK 並手動傳遞。
執行首次推理時,您只需指定模型 ID(如 openai.gpt-5.6-terra)、輸入和最大輸出 token 數,即可透過 Responses API 獲得文本輸出。如需控制推理努力,可設定 reasoning.effort 引數。例如,對於複雜數學問題,可選擇 high 級別獲得更準確的結果。
工具呼叫是 GPT-5.6 的核心功能。您需要將模型輸出中的推理項包含在下一輪輸入中,並在客戶端實現函式呼叫迴圈。這使模型能夠請求外部資料並完成多步任務。生產環境中建議搭配 Amazon Bedrock Guardrails 使用。
控制台體驗已針對新一代推理引擎進行最佳化。您可以透過建立專案、分配模型、配置 API 金鑰並排評估模型。在模型目錄中,您最多可同時比較三個模型,涵蓋 GPT、Claude 和開放權重模型。
提示快取是降低成本的關鍵技術。隱式快取預設啟用,無需程式碼更改。顯式快取允許您透過快取斷點精確控制快取內容。快取輸入享受 90% 折扣,快取寫入按 1.25 倍計費。每個斷點要求字首至少 1024 token,每次請求最多 4 個檢查點。快取有效期為至少 30 分鐘。透過設定一致的 prompt_cache_key 可提高匹配可靠性。例如,將系統指令快取,使用者問題置於斷點之後,可大幅降低重複請求的成本。
總之,GPT-5.6 系列在 Amazon Bedrock 上為開發者提供了強大的 AI 能力,結合 AWS 的安全性與可擴充套件性,能夠滿足從複雜推理到高吞吐生產環境的多樣化需求。