Stoke – 失控AI智能体的终止开关(Rust,预算上限)
Stoke是一个轻量级的Rust网关,在请求到达提供商之前强制实施硬预算上限、循环检测和速率限制,从而防止失控支出。它还提供跨多台机器的本地优先路由、基于成本/速度的自动路由以及失败关闭架构。
Stoke是一款基于Rust构建的轻量级网关,旨在解决AI智能体运行时可能出现的失控问题。当智能体在凌晨开始循环请求时,传统的监控仪表板只能事后报警,而Stoke能在请求到达提供商之前就进行干预。它支持的预算上限以美元为单位,针对每个API密钥设置,一旦超限就直接返回429状态码,让智能体自行处理错误,而非生成账单后再通知用户。
除了预算控制,Stoke还提供了双层循环断路器:通过精确提示哈希匹配和可选的语义相似性检测,即使循环调整措辞也能被识别。同时,每个API密钥都配有滑动窗口速率限制,防止单个智能体占用全部资源。更关键的是,Stoke采用失败关闭架构:如果未配置任何密钥,所有请求都会被拒绝,确保安全性。
在路由方面,Stoke支持本地优先的多节点路由。它会自动轮询Ollama节点,了解哪些模型已加载到RAM中,从而优先将请求路由到已预热节点,并在多个机器间均衡负载。若节点不可用,会自动故障转移。此外,还支持网关之间的联合,让一个Stoke网关作为另一个的后端,实现更丰富的状态共享。
自动路由模式会根据估算成本、预测延迟和用户偏好选择最优模型与节点组合。用户可以选择“auto-cheap”优先考虑成本,或“auto-fast”优先考虑速度。对于小提示词,Stoke还支持竞速分发,向两台机器同时发送请求,以最先完成的为准,且不会增加云成本。
每个请求的决策路径都会以JSON格式返回,包含选择的节点、未选择的节点及其原因,以及如果使用云模型会产生的费用估算。这使得每笔支出都透明可追溯。
Stoke的部署非常简单,只需一个约5.5MB的Rust二进制文件,无需任何运行时依赖。安装命令仅需一行,然后配置好节点和提供商即可运行。目前它主要面向三类用户:使用按量计费API密钥的编码智能体,拥有多台GPU机器的团队,以及需要为AI产品构建控制平面的开发者。后者仍在规划中,正在招募设计伙伴。
与市面上其他类似产品如LiteLLM、Portkey和Helicone相比,Stoke的核心优势在于执行而非监控。它不追求广泛的提供商覆盖或深度的可观测性,而是专注于在请求路径上拒绝违规请求。循环断路器、失败关闭默认设置、节点感知路由和网关联合是它的独特卖点。
需要注意的是,Stoke的硬预算上限仅适用于按量计费的API密钥,对于订阅制计划(如Claude Max或ChatGPT Plus),它无法进行美元上限,但依然可以实施速率限制和循环终止。Stoke强调数据主权,提示词默认留在用户基础设施内,不会发送到云提供商,除非用户明确配置。
总体而言,Stoke为那些受到AI智能体失控困扰的团队提供了一个有效的控制工具,既能在经济上设置护栏,又能在技术上防止无限循环,同时保持本地化部署的灵活性和安全性。