AI News HubLIVE
站內改寫2 分鐘閱讀

為 Amazon Bedrock 上的 OpenAI GPT-5.6 模型引入顯式提示快取

OpenAI GPT-5.6 Sol、Terra 和 Luna 模型已在 Amazon Bedrock 上正式可用,同時引入了顯式提示快取功能,可精確控制提示的快取和重用部分。本文介紹瞭如何開始使用、設定顯式快取以及遷移現有 GPT 工作負載以降低推理成本。

來源AWS Machine Learning Blog作者: Melanie Li

本文與 OpenAI 的 Chris Dickens 合著。

OpenAI GPT-5.6 Sol、Terra 和 Luna 現已在 Amazon Bedrock 上正式可用。透過 Amazon Bedrock 上的 GPT-5.6,您可以獲得最新一代 OpenAI 前沿模型,享受按 token 付費的定價、AWS 的安全與治理控制,並且使用量計入您現有的 AWS 承諾。該系列覆蓋三個能力層級:GPT-5.6 Sol 適用於最複雜的推理和智慧體編碼工作,GPT-5.6 Terra 適用於平衡的日常生產工作負載,GPT-5.6 Luna 適用於快速、高吞吐量的任務,如分類和摘要。

伴隨新模型,GPT-5.6 在 Amazon Bedrock 上引入了顯式提示快取,這是一項新功能,讓您精確控制提示的哪些部分被快取並在請求間重用。快取的輸入享受 90% 折扣(參見 Amazon Bedrock 定價頁面),並在 30 分鐘內可重用。在智慧體工作流中,系統指令、工具定義和參考文件在多次呼叫中重複出現,您能從中獲得最大收益。

本文介紹了 GPT-5.6 在 Amazon Bedrock 上的顯式提示快取,展示它如何區別於隱式快取以及何時使用每種模式,如何設定並驗證其工作,以及在智慧體工作流中的表現。我們還介紹瞭如何將工作負載從早期 GPT 模型遷移到 GPT-5.6,無論這些工作負載當前執行在 Amazon Bedrock 還是其他平臺上。

開始使用 GPT-5.6

GPT-5.6 模型透過 Amazon Bedrock 的 bedrock-mantle 端點上的 OpenAI 相容 Responses API 提供。推薦使用 AWS 憑證生成的短期 bearer token 進行認證。安裝 token 生成器:pip install openai aws-bedrock-token-generator,然後建立客戶端。

最小請求示例:使用 client.responses.create,指定模型 ID(如 openai.gpt-5.6-terra)、指令和輸入。三個模型 ID 分別為 openai.gpt-5.6-solopenai.gpt-5.6-terraopenai.gpt-5.6-luna。Sol 在美東(弗吉尼亞北部)和美東(俄亥俄)可用;Terra 和 Luna 額外在美西(俄勒岡)可用。

控制推理努力

GPT-5.6 支援 reasoning effort 級別:none、low、medium、high、xhigh,預設 medium。更高階別為更困難問題分配更多推理,而 none 為簡單任務提供最低延遲路徑。從早期模型升級時,建議從當前使用的 effort 級別開始,然後測試低一級別,因為 GPT-5.6 更高效。

流式響應

透過 SDK 標準介面支援流式輸出,返回型別化事件。

工具呼叫與結構化輸出

函式呼叫和嚴格 JSON 模式輸出與 OpenAI 原生 API 一致。工具定義使用 Responses API 的扁平格式。結構化輸出需傳入嚴格 JSON schema,模型返回符合 schema 的 JSON。

使用提示快取

GPT-5.6 支援隱式和顯式兩種快取模式。隱式模式下,Amazon Bedrock 自動放置快取斷點並查詢可重用字首。顯式模式要求您標記快取邊界,透過 prompt_cache_breakpointprompt_cache_keyprompt_cache_options 引數控制。快取字首至少 1024 token,最多可設 4 個斷點。

驗證快取行為

每個響應在 usage.input_tokens_details 中報告快取情況:cached_tokens(快取讀取 token,享折扣)和 cache_write_tokens(快取寫入 token,按 1.25 倍計費)。首次請求寫入快取,後續請求讀取快取,輸入 token 僅包含新內容。

選擇快取模式

透過 prompt_cache_options 的 mode 引數切換隱式或顯式。隱式模式無需修改程式碼,適合簡單場景;顯式模式適合穩定字首長且頻繁重用的工作流。注意:streaming 模式下僅支援隱式快取。

遷移現有工作負載

遷移步驟:對映現有 OpenAI 引數到 Responses API,確保系統提示穩定以利用快取,調整 reasoning effort,測試驗證。響應格式不同,需注意 instructions 和系統訊息的區別。

清理

完成測試後移除 AWS 資源以避免持續費用。