为 Amazon Bedrock 上的 OpenAI GPT-5.6 模型引入显式提示缓存
OpenAI GPT-5.6 Sol、Terra 和 Luna 模型已在 Amazon Bedrock 上正式可用,同时引入了显式提示缓存功能,可精确控制提示的缓存和重用部分。本文介绍了如何开始使用、设置显式缓存以及迁移现有 GPT 工作负载以降低推理成本。
本文与 OpenAI 的 Chris Dickens 合著。
OpenAI GPT-5.6 Sol、Terra 和 Luna 现已在 Amazon Bedrock 上正式可用。通过 Amazon Bedrock 上的 GPT-5.6,您可以获得最新一代 OpenAI 前沿模型,享受按 token 付费的定价、AWS 的安全与治理控制,并且使用量计入您现有的 AWS 承诺。该系列覆盖三个能力层级:GPT-5.6 Sol 适用于最复杂的推理和智能体编码工作,GPT-5.6 Terra 适用于平衡的日常生产工作负载,GPT-5.6 Luna 适用于快速、高吞吐量的任务,如分类和摘要。
伴随新模型,GPT-5.6 在 Amazon Bedrock 上引入了显式提示缓存,这是一项新功能,让您精确控制提示的哪些部分被缓存并在请求间重用。缓存的输入享受 90% 折扣(参见 Amazon Bedrock 定价页面),并在 30 分钟内可重用。在智能体工作流中,系统指令、工具定义和参考文档在多次调用中重复出现,您能从中获得最大收益。
本文介绍了 GPT-5.6 在 Amazon Bedrock 上的显式提示缓存,展示它如何区别于隐式缓存以及何时使用每种模式,如何设置并验证其工作,以及在智能体工作流中的表现。我们还介绍了如何将工作负载从早期 GPT 模型迁移到 GPT-5.6,无论这些工作负载当前运行在 Amazon Bedrock 还是其他平台上。
开始使用 GPT-5.6
GPT-5.6 模型通过 Amazon Bedrock 的 bedrock-mantle 端点上的 OpenAI 兼容 Responses API 提供。推荐使用 AWS 凭证生成的短期 bearer token 进行认证。安装 token 生成器:pip install openai aws-bedrock-token-generator,然后创建客户端。
最小请求示例:使用 client.responses.create,指定模型 ID(如 openai.gpt-5.6-terra)、指令和输入。三个模型 ID 分别为 openai.gpt-5.6-sol、openai.gpt-5.6-terra 和 openai.gpt-5.6-luna。Sol 在美东(弗吉尼亚北部)和美东(俄亥俄)可用;Terra 和 Luna 额外在美西(俄勒冈)可用。
控制推理努力
GPT-5.6 支持 reasoning effort 级别:none、low、medium、high、xhigh,默认 medium。更高级别为更困难问题分配更多推理,而 none 为简单任务提供最低延迟路径。从早期模型升级时,建议从当前使用的 effort 级别开始,然后测试低一级别,因为 GPT-5.6 更高效。
流式响应
通过 SDK 标准接口支持流式输出,返回类型化事件。
工具调用与结构化输出
函数调用和严格 JSON 模式输出与 OpenAI 原生 API 一致。工具定义使用 Responses API 的扁平格式。结构化输出需传入严格 JSON schema,模型返回符合 schema 的 JSON。
使用提示缓存
GPT-5.6 支持隐式和显式两种缓存模式。隐式模式下,Amazon Bedrock 自动放置缓存断点并查找可重用前缀。显式模式要求您标记缓存边界,通过 prompt_cache_breakpoint、prompt_cache_key 和 prompt_cache_options 参数控制。缓存前缀至少 1024 token,最多可设 4 个断点。
验证缓存行为
每个响应在 usage.input_tokens_details 中报告缓存情况:cached_tokens(缓存读取 token,享折扣)和 cache_write_tokens(缓存写入 token,按 1.25 倍计费)。首次请求写入缓存,后续请求读取缓存,输入 token 仅包含新内容。
选择缓存模式
通过 prompt_cache_options 的 mode 参数切换隐式或显式。隐式模式无需修改代码,适合简单场景;显式模式适合稳定前缀长且频繁重用的工作流。注意:streaming 模式下仅支持隐式缓存。
迁移现有工作负载
迁移步骤:映射现有 OpenAI 参数到 Responses API,确保系统提示稳定以利用缓存,调整 reasoning effort,测试验证。响应格式不同,需注意 instructions 和系统消息的区别。
清理
完成测试后移除 AWS 资源以避免持续费用。