從澳大利亞通過全球跨區域推理在 Amazon Bedrock 上訪問 OpenAI 模型
澳大利亞的團隊現在可以通過 Amazon Bedrock,從亞太地區(悉尼)和亞太地區(墨爾本)區域使用全球跨區域推理,訪問 OpenAI GPT-5.6 Sol、Terra 和 Luna 模型。本文展示瞭如何調用模型、使用提示緩存、通過 OpenID Connect 設置 Codex,以及使用 Amazon CloudWatch 監控用量。
澳大利亞的團隊現在可以通過 Amazon Bedrock 訪問最新的 OpenAI 模型。Amazon Bedrock 通過全球跨區域推理,在澳大利亞的亞太地區(悉尼)和亞太地區(墨爾本)兩個 AWS 區域提供 OpenAI GPT-5.6 Sol、Terra 和 Luna。您的應用程序調用位於亞太地區(悉尼)或亞太地區(墨爾本)的 Amazon Bedrock Runtime 端點,Amazon Bedrock 會將請求路由到一個受支持的商業 AWS 區域進行處理。這樣可以訪問更大的容量池,而無需應用程序管理目標區域的路由。
GPT-5.6 Sol 適合處理要求較高的推理、編碼和智能體工作負載。Terra 在日常生產使用中平衡了性能和成本。Luna 則為高吞吐量和延遲敏感型應用提供快速、經濟的推理服務。這三個模型都接受文本和圖像輸入,生成文本,並支持高達 100 萬個令牌的上下文窗口。藉助 Amazon Bedrock Runtime 端點,您可以從亞太地區(悉尼)和亞太地區(墨爾本)使用 Responses API、Chat Completions API 和 Converse API 調用這些模型。
本文還展示瞭如何使用提示緩存優化推理成本,如何通過基於 OpenID Connect(OIDC)的身份驗證設置 Codex,以及如何使用 Amazon CloudWatch 和 Coding Agent Insights 監控用量。
全局推理配置文件
文章列出了三個全局配置文件 ID,它們覆蓋了亞太地區(悉尼)和亞太地區(墨爾本)作為源區域,並將請求路由到支持 AWS 區域。配置文件成員資格和模型可用性可能會變化,部署前請查看跨區域推理支持。
開始使用
開始前,您需要完成以下準備工作:一個 AWS 賬户,並啓用亞太地區(悉尼)或亞太地區(墨爾本)作為源區域;如果您的組織使用服務控制策略(SCP),請確認 SCP 允許所選源區域中的 GPT-5.6 全局推理配置文件;一個具有適當權限的 IAM 角色或用户,以便調用 GPT-5.6 推理配置文件;安裝 Python 3.9 或更高版本,並安裝 openai、boto3 和 aws-bedrock-token-generator 包。
您可以使用 AWS 命令行界面(AWS CLI)或 Amazon Bedrock 控制台來驗證全局推理配置文件。AWS CLI 示例命令列出了從悉尼區域可見的 GPT-5.6 配置文件,並檢查 Terra 配置文件的詳細信息。從墨爾本區域運行時,只需將區域 ap-southeast-2 替換為 ap-southeast-4。
調用 GPT-5.6
GPT-5.6 在 Amazon Bedrock Runtime 端點上支持三種訪問路徑:OpenAI Responses API、OpenAI Chat Completions API 和 Amazon Bedrock Converse API。OpenAI 兼容 API 通過端點上的 /openai/v1 路徑調用,而不是通過 AWS SDK。端點接受 AWS 簽名版本 4(SigV4)或 Amazon Bedrock 模型推理 API 密鑰。文章中的示例使用 AWS Bedrock Token Generator for Python 從當前 AWS 憑據生成短期 Amazon Bedrock 模型推理 API 密鑰,因此應用程序無需存儲靜態密鑰。然後,您可以使用此短期 API 密鑰創建 OpenAI 客户端。
對於 Responses API,只需將客户端指向區域級 Amazon Bedrock Runtime 端點。示例代碼展示瞭如何發送請求並打印輸出。對於流式輸出,可設置 stream=True 並迭代事件。對於 Chat Completions API,代碼類似。對於採用 AWS SDK 的現有應用,可以使用 Converse API,Boto3 通過標準 AWS 憑據鏈解析憑據。示例展示了使用 boto3 的調用方式,以及使用 converse_stream 進行流式輸出的方法。所有示例都基於悉尼區域,如需在墨爾本運行,將區域設置為 ap-southeast-4 即可。
提示緩存
GPT-5.6 通過支持的 API 提供提示緩存,支持兩種模式:隱式緩存默認啓用,無需更改代碼;顯式緩存則允許您定義可複用的前綴、緩存邊界和緩存鍵。
使用 Codex
Codex 可以通過 Amazon Bedrock Runtime 使用相同的全局推理配置文件。安裝最新版 Codex CLI 以使用原生 Amazon Bedrock Runtime 模型提供商。對於使用 Okta、Auth0、Microsoft Entra ID、Amazon Cognito 或 AWS IAM Identity Center 作為身份提供商的組織,AWS OIDC Auth Helper 倉庫提供了示例憑據幫助程序。需要先配置身份提供商、對應的 AWS 聯合資源以及具有 Amazon Bedrock 權限的 IAM 角色。然後在 ~/.aws/config 中添加命名配置文件。此聯合幫助程序會將 OIDC 令牌交換為臨時 AWS 憑據,Codex 通過標準 AWS 憑據鏈讀取,無需額外配置。接下來在 ~/.codex/config.toml 中引用 AWS 配置文件,指定模型為 global.openai.gpt-5.6-sol,提供商為 amazon-bedrock-runtime。如果幫助程序沒有有效的緩存會話,它會打開配置的登錄頁面。身份驗證完成後,幫助程序通過 credential_process 返回臨時 AWS 憑據。請求使用 AWS SigV4 簽名,因此在推理路徑中不涉及 API 密鑰。當配置文件由 AWS IAM Identity Center 支持時,憑據已經是短期的,並隨單點登錄會話輪換。
配額管理
GPT-5.6 按需配額以每分鐘請求數(RPM)和每分鐘令牌數(TPM)衡量。令牌消耗計算基於輸入令牌、緩存寫入輸入令牌和輸出令牌乘以模型的消耗速率。例如,對於 GPT-5.6,輸入令牌和緩存寫入輸入令牌按 1:1 計入,而每個輸出令牌消耗配額的 10 個令牌。請從應用程序使用的源區域查看配額,並在生產部署前提前申請增加、監控配額利用率,並測試代表性提示、輸出長度、流式行為、併發性和峯值流量。
監控與日誌記錄
由於 GPT-5.6 請求使用 Amazon Bedrock Runtime API,通過全局推理配置文件發出的請求會像其他按需請求一樣出現在模型調用日誌中。啓用日誌後,記錄中包含用於調用的模型或推理配置文件 ID 以及調用元數據。Codex 使用 OpenTelemetry(OTel)並通過 OTLP/HTTP 導出指標。CloudWatch Coding Agent Insights 提供 Codex 遙測儀表板,包括令牌使用量、API 請求、活躍用户、對話活動以及可選的組織維度。配置方式有 Bearer token 或企業推出兩種。