從澳大利亞透過全球跨區域推理在 Amazon Bedrock 上訪問 OpenAI 模型
澳大利亞的團隊現在可以透過 Amazon Bedrock,從亞太地區(悉尼)和亞太地區(墨爾本)區域使用全球跨區域推理,訪問 OpenAI GPT-5.6 Sol、Terra 和 Luna 模型。本文展示瞭如何呼叫模型、使用提示快取、透過 OpenID Connect 設定 Codex,以及使用 Amazon CloudWatch 監控用量。
澳大利亞的團隊現在可以透過 Amazon Bedrock 訪問最新的 OpenAI 模型。Amazon Bedrock 透過全球跨區域推理,在澳大利亞的亞太地區(悉尼)和亞太地區(墨爾本)兩個 AWS 區域提供 OpenAI GPT-5.6 Sol、Terra 和 Luna。您的應用程式呼叫位於亞太地區(悉尼)或亞太地區(墨爾本)的 Amazon Bedrock Runtime 端點,Amazon Bedrock 會將請求路由到一個受支援的商業 AWS 區域進行處理。這樣可以訪問更大的容量池,而無需應用程式管理目標區域的路由。
GPT-5.6 Sol 適合處理要求較高的推理、編碼和智慧體工作負載。Terra 在日常生產使用中平衡了效能和成本。Luna 則為高吞吐量和延遲敏感型應用提供快速、經濟的推理服務。這三個模型都接受文本和影像輸入,生成文本,並支援高達 100 萬個令牌的上下文視窗。藉助 Amazon Bedrock Runtime 端點,您可以從亞太地區(悉尼)和亞太地區(墨爾本)使用 Responses API、Chat Completions API 和 Converse API 呼叫這些模型。
本文還展示瞭如何使用提示快取最佳化推理成本,如何透過基於 OpenID Connect(OIDC)的身份驗證設定 Codex,以及如何使用 Amazon CloudWatch 和 Coding Agent Insights 監控用量。
全域性推理配置檔案
文章列出了三個全域性配置檔案 ID,它們覆蓋了亞太地區(悉尼)和亞太地區(墨爾本)作為源區域,並將請求路由到支援 AWS 區域。配置檔案成員資格和模型可用性可能會變化,部署前請檢視跨區域推理支援。
開始使用
開始前,您需要完成以下準備工作:一個 AWS 賬戶,並啟用亞太地區(悉尼)或亞太地區(墨爾本)作為源區域;如果您的組織使用服務控制策略(SCP),請確認 SCP 允許所選源區域中的 GPT-5.6 全域性推理配置檔案;一個具有適當許可權的 IAM 角色或使用者,以便呼叫 GPT-5.6 推理配置檔案;安裝 Python 3.9 或更高版本,並安裝 openai、boto3 和 aws-bedrock-token-generator 包。
您可以使用 AWS 命令列介面(AWS CLI)或 Amazon Bedrock 控制台來驗證全域性推理配置檔案。AWS CLI 示例命令列出了從悉尼區域可見的 GPT-5.6 配置檔案,並檢查 Terra 配置檔案的詳細資訊。從墨爾本區域執行時,只需將區域 ap-southeast-2 替換為 ap-southeast-4。
呼叫 GPT-5.6
GPT-5.6 在 Amazon Bedrock Runtime 端點上支援三種訪問路徑:OpenAI Responses API、OpenAI Chat Completions API 和 Amazon Bedrock Converse API。OpenAI 相容 API 透過端點上的 /openai/v1 路徑呼叫,而不是透過 AWS SDK。端點接受 AWS 簽名版本 4(SigV4)或 Amazon Bedrock 模型推理 API 金鑰。文章中的示例使用 AWS Bedrock Token Generator for Python 從當前 AWS 憑據生成短期 Amazon Bedrock 模型推理 API 金鑰,因此應用程式無需儲存靜態金鑰。然後,您可以使用此短期 API 金鑰建立 OpenAI 客戶端。
對於 Responses API,只需將客戶端指向區域級 Amazon Bedrock Runtime 端點。示例程式碼展示瞭如何傳送請求並列印輸出。對於流式輸出,可設定 stream=True 並迭代事件。對於 Chat Completions API,程式碼類似。對於採用 AWS SDK 的現有應用,可以使用 Converse API,Boto3 透過標準 AWS 憑據鏈解析憑據。示例展示了使用 boto3 的呼叫方式,以及使用 converse_stream 進行流式輸出的方法。所有示例都基於悉尼區域,如需在墨爾本執行,將區域設定為 ap-southeast-4 即可。
提示快取
GPT-5.6 透過支援的 API 提供提示快取,支援兩種模式:隱式快取預設啟用,無需更改程式碼;顯式快取則允許您定義可複用的字首、快取邊界和快取鍵。
使用 Codex
Codex 可以透過 Amazon Bedrock Runtime 使用相同的全域性推理配置檔案。安裝最新版 Codex CLI 以使用原生 Amazon Bedrock Runtime 模型提供商。對於使用 Okta、Auth0、Microsoft Entra ID、Amazon Cognito 或 AWS IAM Identity Center 作為身份提供商的組織,AWS OIDC Auth Helper 倉庫提供了示例憑據幫助程式。需要先配置身份提供商、對應的 AWS 聯合資源以及具有 Amazon Bedrock 許可權的 IAM 角色。然後在 ~/.aws/config 中新增命名配置檔案。此聯合幫助程式會將 OIDC 令牌交換為臨時 AWS 憑據,Codex 透過標準 AWS 憑據鏈讀取,無需額外配置。接下來在 ~/.codex/config.toml 中引用 AWS 配置檔案,指定模型為 global.openai.gpt-5.6-sol,提供商為 amazon-bedrock-runtime。如果幫助程式沒有有效的快取會話,它會開啟配置的登入頁面。身份驗證完成後,幫助程式透過 credential_process 返回臨時 AWS 憑據。請求使用 AWS SigV4 簽名,因此在推理路徑中不涉及 API 金鑰。當配置檔案由 AWS IAM Identity Center 支援時,憑據已經是短期的,並隨單點登入會話輪換。
配額管理
GPT-5.6 按需配額以每分鐘請求數(RPM)和每分鐘令牌數(TPM)衡量。令牌消耗計算基於輸入令牌、快取寫入輸入令牌和輸出令牌乘以模型的消耗速率。例如,對於 GPT-5.6,輸入令牌和快取寫入輸入令牌按 1:1 計入,而每個輸出令牌消耗配額的 10 個令牌。請從應用程式使用的源區域檢視配額,並在生產部署前提前申請增加、監控配額利用率,並測試代表性提示、輸出長度、流式行為、併發性和峰值流量。
監控與日誌記錄
由於 GPT-5.6 請求使用 Amazon Bedrock Runtime API,透過全域性推理配置檔案發出的請求會像其他按需請求一樣出現在模型呼叫日誌中。啟用日誌後,記錄中包含用於呼叫的模型或推理配置檔案 ID 以及呼叫後設資料。Codex 使用 OpenTelemetry(OTel)並透過 OTLP/HTTP 匯出指標。CloudWatch Coding Agent Insights 提供 Codex 遙測儀表板,包括令牌使用量、API 請求、活躍使用者、對話活動以及可選的組織維度。配置方式有 Bearer token 或企業推出兩種。