AI News HubLIVE
站內改寫2 分鐘閱讀

Stoke – 失控AI智能體的終止開關(Rust,預算上限)

Stoke是一個輕量級的Rust網關,在請求到達提供商之前強制實施硬預算上限、循環檢測和速率限制,從而防止失控支出。它還提供跨多台機器的本地優先路由、基於成本/速度的自動路由以及失敗關閉架構。

來源Hacker News AI作者: pawfromoz

Stoke是一款基於Rust構建的輕量級網關,旨在解決AI智能體運行時可能出現的失控問題。當智能體在凌晨開始循環請求時,傳統的監控儀表板只能事後報警,而Stoke能在請求到達提供商之前就進行干預。它支持的預算上限以美元為單位,針對每個API密鑰設置,一旦超限就直接返回429狀態碼,讓智能體自行處理錯誤,而非生成賬單後再通知用户。

除了預算控制,Stoke還提供了雙層循環斷路器:通過精確提示哈希匹配和可選的語義相似性檢測,即使循環調整措辭也能被識別。同時,每個API密鑰都配有滑動窗口速率限制,防止單個智能體佔用全部資源。更關鍵的是,Stoke採用失敗關閉架構:如果未配置任何密鑰,所有請求都會被拒絕,確保安全性。

在路由方面,Stoke支持本地優先的多節點路由。它會自動輪詢Ollama節點,瞭解哪些模型已加載到RAM中,從而優先將請求路由到已預熱節點,並在多個機器間均衡負載。若節點不可用,會自動故障轉移。此外,還支持網關之間的聯合,讓一個Stoke網關作為另一個的後端,實現更豐富的狀態共享。

自動路由模式會根據估算成本、預測延遲和用户偏好選擇最優模型與節點組合。用户可以選擇“auto-cheap”優先考慮成本,或“auto-fast”優先考慮速度。對於小提示詞,Stoke還支持競速分發,向兩台機器同時發送請求,以最先完成的為準,且不會增加雲成本。

每個請求的決策路徑都會以JSON格式返回,包含選擇的節點、未選擇的節點及其原因,以及如果使用雲模型會產生的費用估算。這使得每筆支出都透明可追溯。

Stoke的部署非常簡單,只需一個約5.5MB的Rust二進制文件,無需任何運行時依賴。安裝命令僅需一行,然後配置好節點和提供商即可運行。目前它主要面向三類用户:使用按量計費API密鑰的編碼智能體,擁有多台GPU機器的團隊,以及需要為AI產品構建控制平面的開發者。後者仍在規劃中,正在招募設計夥伴。

與市面上其他類似產品如LiteLLM、Portkey和Helicone相比,Stoke的核心優勢在於執行而非監控。它不追求廣泛的提供商覆蓋或深度的可觀測性,而是專注於在請求路徑上拒絕違規請求。循環斷路器、失敗關閉默認設置、節點感知路由和網關聯合是它的獨特賣點。

需要注意的是,Stoke的硬預算上限僅適用於按量計費的API密鑰,對於訂閲制計劃(如Claude Max或ChatGPT Plus),它無法進行美元上限,但依然可以實施速率限制和循環終止。Stoke強調數據主權,提示詞默認留在用户基礎設施內,不會發送到雲提供商,除非用户明確配置。

總體而言,Stoke為那些受到AI智能體失控困擾的團隊提供了一個有效的控制工具,既能在經濟上設置護欄,又能在技術上防止無限循環,同時保持本地化部署的靈活性和安全性。