从澳大利亚通过全球跨区域推理在 Amazon Bedrock 上访问 OpenAI 模型
澳大利亚的团队现在可以通过 Amazon Bedrock,从亚太地区(悉尼)和亚太地区(墨尔本)区域使用全球跨区域推理,访问 OpenAI GPT-5.6 Sol、Terra 和 Luna 模型。本文展示了如何调用模型、使用提示缓存、通过 OpenID Connect 设置 Codex,以及使用 Amazon CloudWatch 监控用量。
澳大利亚的团队现在可以通过 Amazon Bedrock 访问最新的 OpenAI 模型。Amazon Bedrock 通过全球跨区域推理,在澳大利亚的亚太地区(悉尼)和亚太地区(墨尔本)两个 AWS 区域提供 OpenAI GPT-5.6 Sol、Terra 和 Luna。您的应用程序调用位于亚太地区(悉尼)或亚太地区(墨尔本)的 Amazon Bedrock Runtime 端点,Amazon Bedrock 会将请求路由到一个受支持的商业 AWS 区域进行处理。这样可以访问更大的容量池,而无需应用程序管理目标区域的路由。
GPT-5.6 Sol 适合处理要求较高的推理、编码和智能体工作负载。Terra 在日常生产使用中平衡了性能和成本。Luna 则为高吞吐量和延迟敏感型应用提供快速、经济的推理服务。这三个模型都接受文本和图像输入,生成文本,并支持高达 100 万个令牌的上下文窗口。借助 Amazon Bedrock Runtime 端点,您可以从亚太地区(悉尼)和亚太地区(墨尔本)使用 Responses API、Chat Completions API 和 Converse API 调用这些模型。
本文还展示了如何使用提示缓存优化推理成本,如何通过基于 OpenID Connect(OIDC)的身份验证设置 Codex,以及如何使用 Amazon CloudWatch 和 Coding Agent Insights 监控用量。
全局推理配置文件
文章列出了三个全局配置文件 ID,它们覆盖了亚太地区(悉尼)和亚太地区(墨尔本)作为源区域,并将请求路由到支持 AWS 区域。配置文件成员资格和模型可用性可能会变化,部署前请查看跨区域推理支持。
开始使用
开始前,您需要完成以下准备工作:一个 AWS 账户,并启用亚太地区(悉尼)或亚太地区(墨尔本)作为源区域;如果您的组织使用服务控制策略(SCP),请确认 SCP 允许所选源区域中的 GPT-5.6 全局推理配置文件;一个具有适当权限的 IAM 角色或用户,以便调用 GPT-5.6 推理配置文件;安装 Python 3.9 或更高版本,并安装 openai、boto3 和 aws-bedrock-token-generator 包。
您可以使用 AWS 命令行界面(AWS CLI)或 Amazon Bedrock 控制台来验证全局推理配置文件。AWS CLI 示例命令列出了从悉尼区域可见的 GPT-5.6 配置文件,并检查 Terra 配置文件的详细信息。从墨尔本区域运行时,只需将区域 ap-southeast-2 替换为 ap-southeast-4。
调用 GPT-5.6
GPT-5.6 在 Amazon Bedrock Runtime 端点上支持三种访问路径:OpenAI Responses API、OpenAI Chat Completions API 和 Amazon Bedrock Converse API。OpenAI 兼容 API 通过端点上的 /openai/v1 路径调用,而不是通过 AWS SDK。端点接受 AWS 签名版本 4(SigV4)或 Amazon Bedrock 模型推理 API 密钥。文章中的示例使用 AWS Bedrock Token Generator for Python 从当前 AWS 凭据生成短期 Amazon Bedrock 模型推理 API 密钥,因此应用程序无需存储静态密钥。然后,您可以使用此短期 API 密钥创建 OpenAI 客户端。
对于 Responses API,只需将客户端指向区域级 Amazon Bedrock Runtime 端点。示例代码展示了如何发送请求并打印输出。对于流式输出,可设置 stream=True 并迭代事件。对于 Chat Completions API,代码类似。对于采用 AWS SDK 的现有应用,可以使用 Converse API,Boto3 通过标准 AWS 凭据链解析凭据。示例展示了使用 boto3 的调用方式,以及使用 converse_stream 进行流式输出的方法。所有示例都基于悉尼区域,如需在墨尔本运行,将区域设置为 ap-southeast-4 即可。
提示缓存
GPT-5.6 通过支持的 API 提供提示缓存,支持两种模式:隐式缓存默认启用,无需更改代码;显式缓存则允许您定义可复用的前缀、缓存边界和缓存键。
使用 Codex
Codex 可以通过 Amazon Bedrock Runtime 使用相同的全局推理配置文件。安装最新版 Codex CLI 以使用原生 Amazon Bedrock Runtime 模型提供商。对于使用 Okta、Auth0、Microsoft Entra ID、Amazon Cognito 或 AWS IAM Identity Center 作为身份提供商的组织,AWS OIDC Auth Helper 仓库提供了示例凭据帮助程序。需要先配置身份提供商、对应的 AWS 联合资源以及具有 Amazon Bedrock 权限的 IAM 角色。然后在 ~/.aws/config 中添加命名配置文件。此联合帮助程序会将 OIDC 令牌交换为临时 AWS 凭据,Codex 通过标准 AWS 凭据链读取,无需额外配置。接下来在 ~/.codex/config.toml 中引用 AWS 配置文件,指定模型为 global.openai.gpt-5.6-sol,提供商为 amazon-bedrock-runtime。如果帮助程序没有有效的缓存会话,它会打开配置的登录页面。身份验证完成后,帮助程序通过 credential_process 返回临时 AWS 凭据。请求使用 AWS SigV4 签名,因此在推理路径中不涉及 API 密钥。当配置文件由 AWS IAM Identity Center 支持时,凭据已经是短期的,并随单点登录会话轮换。
配额管理
GPT-5.6 按需配额以每分钟请求数(RPM)和每分钟令牌数(TPM)衡量。令牌消耗计算基于输入令牌、缓存写入输入令牌和输出令牌乘以模型的消耗速率。例如,对于 GPT-5.6,输入令牌和缓存写入输入令牌按 1:1 计入,而每个输出令牌消耗配额的 10 个令牌。请从应用程序使用的源区域查看配额,并在生产部署前提前申请增加、监控配额利用率,并测试代表性提示、输出长度、流式行为、并发性和峰值流量。
监控与日志记录
由于 GPT-5.6 请求使用 Amazon Bedrock Runtime API,通过全局推理配置文件发出的请求会像其他按需请求一样出现在模型调用日志中。启用日志后,记录中包含用于调用的模型或推理配置文件 ID 以及调用元数据。Codex 使用 OpenTelemetry(OTel)并通过 OTLP/HTTP 导出指标。CloudWatch Coding Agent Insights 提供 Codex 遥测仪表板,包括令牌使用量、API 请求、活跃用户、对话活动以及可选的组织维度。配置方式有 Bearer token 或企业推出两种。