Stoke – 失控AI智慧體的終止開關(Rust,預算上限)
Stoke是一個輕量級的Rust閘道器,在請求到達提供商之前強制實施硬預算上限、迴圈檢測和速率限制,從而防止失控支出。它還提供跨多臺機器的本地優先路由、基於成本/速度的自動路由以及失敗關閉架構。
Stoke是一款基於Rust構建的輕量級閘道器,旨在解決AI智慧體執行時可能出現的失控問題。當智慧體在凌晨開始迴圈請求時,傳統的監控儀表板只能事後報警,而Stoke能在請求到達提供商之前就進行干預。它支援的預算上限以美元為單位,針對每個API金鑰設定,一旦超限就直接返回429狀態碼,讓智慧體自行處理錯誤,而非生成賬單後再通知使用者。
除了預算控制,Stoke還提供了雙層迴圈斷路器:透過精確提示雜湊匹配和可選的語義相似性檢測,即使迴圈調整措辭也能被識別。同時,每個API金鑰都配有滑動視窗速率限制,防止單個智慧體佔用全部資源。更關鍵的是,Stoke採用失敗關閉架構:如果未配置任何金鑰,所有請求都會被拒絕,確保安全性。
在路由方面,Stoke支援本地優先的多節點路由。它會自動輪詢Ollama節點,瞭解哪些模型已載入到RAM中,從而優先將請求路由到已預熱節點,並在多個機器間均衡負載。若節點不可用,會自動故障轉移。此外,還支援閘道器之間的聯合,讓一個Stoke閘道器作為另一個的後端,實現更豐富的狀態共享。
自動路由模式會根據估算成本、預測延遲和使用者偏好選擇最優模型與節點組合。使用者可以選擇“auto-cheap”優先考慮成本,或“auto-fast”優先考慮速度。對於小提示詞,Stoke還支援競速分發,向兩臺機器同時傳送請求,以最先完成的為準,且不會增加雲成本。
每個請求的決策路徑都會以JSON格式返回,包含選擇的節點、未選擇的節點及其原因,以及如果使用雲模型會產生的費用估算。這使得每筆支出都透明可追溯。
Stoke的部署非常簡單,只需一個約5.5MB的Rust二進位制檔案,無需任何執行時依賴。安裝命令僅需一行,然後配置好節點和提供商即可執行。目前它主要面向三類使用者:使用按量計費API金鑰的編碼智慧體,擁有多臺GPU機器的團隊,以及需要為AI產品構建控制平面的開發者。後者仍在規劃中,正在招募設計夥伴。
與市面上其他類似產品如LiteLLM、Portkey和Helicone相比,Stoke的核心優勢在於執行而非監控。它不追求廣泛的提供商覆蓋或深度的可觀測性,而是專注於在請求路徑上拒絕違規請求。迴圈斷路器、失敗關閉預設設定、節點感知路由和閘道器聯合是它的獨特賣點。
需要注意的是,Stoke的硬預算上限僅適用於按量計費的API金鑰,對於訂閱制計劃(如Claude Max或ChatGPT Plus),它無法進行美元上限,但依然可以實施速率限制和迴圈終止。Stoke強調資料主權,提示詞預設留在使用者基礎設施內,不會傳送到雲提供商,除非使用者明確配置。
總體而言,Stoke為那些受到AI智慧體失控困擾的團隊提供了一個有效的控制工具,既能在經濟上設定護欄,又能在技術上防止無限迴圈,同時保持本地化部署的靈活性和安全性。