AI News HubLIVE
站內改寫1 分鐘閱讀

Ramp AI 路由器:為每個請求選擇最佳模型,成本降低30%

Ramp 釋出了 AI 路由器(Router),透過為每個請求自動選擇最合適的語言模型,在保持效能的同時將 LLM 成本降低 30%,並支援 100 多種 AI 用例。該工具現已對外開放。

來源Hacker News AI作者: robbiet480

Ramp 近日正式釋出了其 AI 路由器(Router),這是一款旨在為每個請求自動選擇最合適語言模型的工具。Ramp 內部已使用該路由器管理超過 100 個 AI 用例,成功將 LLM 成本降低了 30%,同時使功能更智慧、響應更迅速。現在,Ramp 將這一工具開放給所有使用者。

路由器的工作原理是分析請求的複雜性、延遲要求和成本約束,然後從多個候選模型中選出最佳匹配。例如,對於結構化資料提取任務(如從發票中提取行專案),它選擇適合高吞吐量的模型;對於需要複雜推理的合同續約風險審查,則偏向高準確率模型。支援模型包括 Google 的 Gemini 3 Flash、Gemini 3.5 Flash、Gemini 3.1 Pro、Gemini 3.1 Flash Lite,Anthropic 的 Claude Haiku 4.5、Claude Sonnet 5、Claude Opus 4.8、Claude Fable 5,以及 xAI 的 Grok 4.5 等。Router 會持續評估新模型,並自動將請求路由到透過質量門檻的最低成本模型。

除路由功能外,Router 還整合了 100 多種最佳化措施,如智慧快取、提示壓縮、語義歸因、Flex vs Standard 路由等,進一步降低成本和延遲。Ramp 聲稱路由器的可靠性達到 99.999%,每月處理超過 2.75 萬億個 Token,並且僅增加約 30 毫秒的延遲。

此外,Ramp 提供了 Token 支出管理工具,允許使用者按模型、產品、團隊和專案追蹤每一筆 AI 呼叫開銷,幫助企業更好地控制 AI 預算。示例顯示,透過 Router 和支出管理,總支出可降低 32%,每百萬 Tokens 價格降至 9 美元。

Ramp 的 AI 路由器僅需幾行程式碼即可整合,開發者可以透過統一的 API 端點(如 curl 示例)呼叫多種閉源和開源模型。路由器自動處理模型選擇、回退和提供商更新,讓應用程式無需修改即可受益於新模型。

Ramp CTO Rahul Sengottuvelu 表示:“Router 讓我們的 LLM 成本降低了 30%,同時讓功能更智慧、更快速。”這一工具的釋出有望幫助更多企業最佳化 AI 工作負載的價效比。