AI News HubLIVE
站內改寫2 分鐘閱讀

Launch HN: Tokenless (YC S26) – 自動模型切換,節省AI推理成本

Tokenless 是一個智慧路由器,它透過並行向多個模型傳送請求並選擇最佳結果,自動取消其他模型,從而將AI推理成本降低一半,同時保持輸出質量。

來源Hacker News AI作者: rohaga

Tokenless 是一款創新的AI模型路由器,專為降低大型語言模型的推理成本而設計。它作為一個即插即用的API端點,完全相容OpenAI和Anthropic的呼叫格式,使用者只需將現有的API地址替換為Tokenless的端點,即可立即開始使用,無需修改任何程式碼。其核心工作原理是智慧並行排程:當收到一個請求時,Tokenless會同時向一組經過精心挑選的模型(包括開源和閉源模型)傳送相同的任務,並即時監控每個模型的推理進度。一旦某個模型展現出清晰的解決路徑,系統會立即選擇該模型作為最終輸出,並自動取消其他所有正在處理的請求。這意味著使用者只需為最終使用的模型付費,而避免了為簡單任務支付前沿模型的高昂開銷。

Tokenless 的實際效果已經在公開的編碼基準測試中得到了驗證。在TerminalBench 2.1測試中,Tokenless的PRO模式以72%的解決率達到了與Opus 4.8相同的質量水平,但每任務成本僅為0.32美元,相比Opus 4.8的2.41美元降低了57%。在LiveCodeBench測試中,PRO模式以89.0%的解決率略高於GPT 5.5的85.7%,同時總成本更低。對於追求最高質量的使用者,Tokenless還提供了MAX模式,該模式會為每個任務自動選擇當前可用的最佳模型,雖然成本較高,但能獲得更高的解決率(TerminalBench上為82%)。這些資料清楚地表明,Tokenless能夠在保持輸出質量的前提下顯著降低推理成本。

除了基準測試,Tokenless還提供了一個成本模擬器,允許使用者輸入自己的月度LLM支出,從而估算透過使用Tokenless可以節省的費用。例如,如果一個使用者當前每月支付40,000美元的AI推理費用,Tokenless預計可以將其降至26,000美元,節省率達34%。這個估算基於公開的token價格和可調的路由假設,實際節省取決於使用者的流量模式。此外,Tokenless還參考了Ramp AI Index的支出趨勢,該指數顯示AI支出每月增長約11%,因此長期節省潛力更大。

Tokenless 的團隊由來自Google DeepMind、普林斯頓大學和加州大學伯克利分校的AI研究員組成,他們已經獲得了Y Combinator的種子輪投資。公司提供免費的演示服務,使用者可以透過提交實際流量資料來獲得定製化的節省報告。Tokenless的目標是成為AI推理的預設路由器,讓每個請求都能自動匹配最合適的模型,從而在不犧牲質量的前提下最大化成本效益。