谷歌云上AI代理的结构:完整指南
本文详细介绍了在谷歌云上构建和部署AI代理的完整架构,涵盖模型选择、框架、运行时、工具、记忆以及从原型到生产的跨领域关注点。提供了基于ADK、Cloud Run和Agent Runtime的决策指南和参考架构。
在谷歌云上构建AI代理时,开发者常常面临众多产品名称的困惑:ADK、Agent Runtime、Cloud Run、GKE、Gemini Enterprise Agent Platform。本文旨在梳理这一生态系统,提供清晰的决策路径。
每个AI代理本质上由五个相同部分组成:一个能推理的模型、可调用的工具、记忆(避免短期记忆)、连接各部分直至任务完成的运行时循环,以及日益重要的代理间连接。谷歌云的所有服务都填充这些角色,并涵盖可观测性、安全性和评估等跨领域生产关注点。
模型层:典型的大脑是Gemini 3.x系列——Gemini 3.1 Pro用于复杂推理,Flash层级作为成本效益高的主力。Model Garden提供200+模型,包括Anthropic的Claude和开源模型如GLM、Kimi、DeepSeek。自托管开源模型也实用,Gemma 4支持函数调用和结构化输出,Cloud Run GPU可服务多种规模模型。
框架层:Agent Development Kit (ADK)是谷歌的开源代码优先框架,支持Python、Go、Java等语言。ADK 2.0采用基于图的执行引擎,支持并行工作流、自动重试和人机交互。此外,Agent Runtime也支持LangGraph、LangChain等框架。
运行时层:Agent Runtime是“全面托管”选项,提供会话、记忆、沙盒代码执行和可观测性。Cloud Run作为标准容器运行代理,是社区热门选择,支持聊天后端、工作池、批处理任务和GPU服务。GKE适合管理代理舰队或自托管模型。
工具和知识:工具通过MCP协议聚合,谷歌为数据库和服务提供托管MCP服务器。代理间协调使用A2A协议。知识检索范围从开箱即用的Agent Search到可调优的RAG Engine和原始Vector Search。
状态与记忆:关键区别在于会话状态(当前对话的工作区)与长期记忆(跨会话存留的提炼事实)。ADK提供内存、Postgres或Agent Runtime托管会话三种后端。Memory Bank使用生成式AI提取和整合用户事实,而非存储完整记录。
跨领域关注点:从原型到生产需弥补三大差距:可观测性(ADK输出OpenTelemetry轨迹)、评估(adk eval评分工具调用轨迹)、安全(最小权限服务账户、Model Armor、人工确认)。
决策指南:最简洁的实话:从Cloud Run上的ADK开始,当需要托管会话、记忆和评估时采用Agent Runtime,当运行代理舰队时升级到GKE。
参考架构:典型生产代理配置可能包括:ADK on Cloud Run、现有认证、默认Gemini Flash、MCP工具、Cloud SQL存储会话状态、Memory Bank长期记忆、Cloud Trace跟踪。每个组件都可替换。
这些构建块已足够稳定,可投入生产。要深入探索,Agent Factory播客和adk-samples示例代码是快速上手的途径。