在 Amazon Bedrock 上开始使用 OpenAI GPT-5.6 Sol、Terra 和 Luna
OpenAI GPT-5.6 Sol、Terra 和 Luna 现已普遍可用,可通过 Amazon Bedrock 上的 bedrock-mantle 端点访问。本文介绍了如何选择模型、使用 Responses API 进行推理、通过提示缓存降低成本、连接 OpenAI Codex 编码代理以及规划配额和扩展。
OpenAI GPT-5.6 系列模型——Sol、Terra 和 Luna——现已通过 Amazon Bedrock 正式上线,开发者可以通过熟悉的 OpenAI Responses API 调用这些前沿模型,而无需管理单独的模型基础设施。这些模型覆盖从自主编码代理、长时推理到高吞吐、低延迟推理的各种工作负载,并享受 AWS 的安全、区域处理和成本控制优势。
所有三个模型均可通过 bedrock-mantle 端点上的 Responses API 访问。Sol 是旗舰推理模型,Terra 平衡性能和成本,适用于日常生产工作,而 Luna 则针对快速、低成本推理进行了优化。定价与 OpenAI 首方价格一致,使用量计入现有 AWS 承诺。
模型规格概览:Sol 适用于自主编码、安全研究、科学分析和深度多步推理,目前在美国东部(弗吉尼亚北部)和俄亥俄区域可用。Terra 适用于通用生产工作负载,在上述区域及美国西部(俄勒冈)可用。Luna 则面向分类、摘要和路由等高吞吐、延迟敏感型任务,区域覆盖与 Terra 相同。所有模型均支持文本和图像输入、文本输出、272K token 上下文窗口,以及从 none 到 max 的推理努力级别。
要开始使用,您需要一个拥有 bedrock-mantle 端点推理权限的 AWS 账号。建议附加 AmazonBedrockMantleInferenceAccess 托管策略。安装 OpenAI Python SDK 2.45.0 或更高版本,并通过自动刷新的短期密钥或环境变量进行身份验证。自动刷新方式使用 BedrockOpenAI 客户端和 token 提供程序;环境变量方式设置 AWS_BEARER_TOKEN_BEDROCK 并手动传递。
运行首次推理时,您只需指定模型 ID(如 openai.gpt-5.6-terra)、输入和最大输出 token 数,即可通过 Responses API 获得文本输出。如需控制推理努力,可设置 reasoning.effort 参数。例如,对于复杂数学问题,可选择 high 级别获得更准确的结果。
工具调用是 GPT-5.6 的核心功能。您需要将模型输出中的推理项包含在下一轮输入中,并在客户端实现函数调用循环。这使模型能够请求外部数据并完成多步任务。生产环境中建议搭配 Amazon Bedrock Guardrails 使用。
控制台体验已针对新一代推理引擎进行优化。您可以通过创建项目、分配模型、配置 API 密钥并排评估模型。在模型目录中,您最多可同时比较三个模型,涵盖 GPT、Claude 和开放权重模型。
提示缓存是降低成本的关键技术。隐式缓存默认启用,无需代码更改。显式缓存允许您通过缓存断点精确控制缓存内容。缓存输入享受 90% 折扣,缓存写入按 1.25 倍计费。每个断点要求前缀至少 1024 token,每次请求最多 4 个检查点。缓存有效期为至少 30 分钟。通过设置一致的 prompt_cache_key 可提高匹配可靠性。例如,将系统指令缓存,用户问题置于断点之后,可大幅降低重复请求的成本。
总之,GPT-5.6 系列在 Amazon Bedrock 上为开发者提供了强大的 AI 能力,结合 AWS 的安全性与可扩展性,能够满足从复杂推理到高吞吐生产环境的多样化需求。