谷歌雲上AI代理的結構:完整指南
本文詳細介紹了在谷歌雲上構建和部署AI代理的完整架構,涵蓋模型選擇、框架、執行時、工具、記憶以及從原型到生產的跨領域關注點。提供了基於ADK、Cloud Run和Agent Runtime的決策指南和參考架構。
在谷歌雲上構建AI代理時,開發者常常面臨眾多產品名稱的困惑:ADK、Agent Runtime、Cloud Run、GKE、Gemini Enterprise Agent Platform。本文旨在梳理這一生態系統,提供清晰的決策路徑。
每個AI代理本質上由五個相同部分組成:一個能推理的模型、可呼叫的工具、記憶(避免短期記憶)、連線各部分直至任務完成的執行時迴圈,以及日益重要的代理間連線。谷歌雲的所有服務都填充這些角色,並涵蓋可觀測性、安全性和評估等跨領域生產關注點。
模型層:典型的大腦是Gemini 3.x系列——Gemini 3.1 Pro用於複雜推理,Flash層級作為成本效益高的主力。Model Garden提供200+模型,包括Anthropic的Claude和開源模型如GLM、Kimi、DeepSeek。自託管開源模型也實用,Gemma 4支援函式呼叫和結構化輸出,Cloud Run GPU可服務多種規模模型。
框架層:Agent Development Kit (ADK)是谷歌的開原始碼優先框架,支援Python、Go、Java等語言。ADK 2.0採用基於圖的執行引擎,支援並行工作流、自動重試和人機互動。此外,Agent Runtime也支援LangGraph、LangChain等框架。
執行時層:Agent Runtime是“全面託管”選項,提供會話、記憶、沙盒程式碼執行和可觀測性。Cloud Run作為標準容器執行代理,是社群熱門選擇,支援聊天后端、工作池、批處理任務和GPU服務。GKE適合管理代理艦隊或自託管模型。
工具和知識:工具透過MCP協議聚合,谷歌為資料庫和服務提供託管MCP伺服器。代理間協調使用A2A協議。知識檢索範圍從開箱即用的Agent Search到可調優的RAG Engine和原始Vector Search。
狀態與記憶:關鍵區別在於會話狀態(當前對話的工作區)與長期記憶(跨會話存留的提煉事實)。ADK提供記憶體、Postgres或Agent Runtime託管會話三種後端。Memory Bank使用生成式AI提取和整合使用者事實,而非儲存完整記錄。
跨領域關注點:從原型到生產需彌補三大差距:可觀測性(ADK輸出OpenTelemetry軌跡)、評估(adk eval評分工具呼叫軌跡)、安全(最小許可權服務賬戶、Model Armor、人工確認)。
決策指南:最簡潔的實話:從Cloud Run上的ADK開始,當需要託管會話、記憶和評估時採用Agent Runtime,當執行代理艦隊時升級到GKE。
參考架構:典型生產代理配置可能包括:ADK on Cloud Run、現有認證、預設Gemini Flash、MCP工具、Cloud SQL儲存會話狀態、Memory Bank長期記憶、Cloud Trace跟蹤。每個元件都可替換。
這些構建塊已足夠穩定,可投入生產。要深入探索,Agent Factory播客和adk-samples示例程式碼是快速上手的途徑。