Ramp AI 路由器:为每个请求选择最佳模型,成本降低30%
Ramp 发布了 AI 路由器(Router),通过为每个请求自动选择最合适的语言模型,在保持性能的同时将 LLM 成本降低 30%,并支持 100 多种 AI 用例。该工具现已对外开放。
Ramp 近日正式发布了其 AI 路由器(Router),这是一款旨在为每个请求自动选择最合适语言模型的工具。Ramp 内部已使用该路由器管理超过 100 个 AI 用例,成功将 LLM 成本降低了 30%,同时使功能更智能、响应更迅速。现在,Ramp 将这一工具开放给所有用户。
路由器的工作原理是分析请求的复杂性、延迟要求和成本约束,然后从多个候选模型中选出最佳匹配。例如,对于结构化数据提取任务(如从发票中提取行项目),它选择适合高吞吐量的模型;对于需要复杂推理的合同续约风险审查,则偏向高准确率模型。支持模型包括 Google 的 Gemini 3 Flash、Gemini 3.5 Flash、Gemini 3.1 Pro、Gemini 3.1 Flash Lite,Anthropic 的 Claude Haiku 4.5、Claude Sonnet 5、Claude Opus 4.8、Claude Fable 5,以及 xAI 的 Grok 4.5 等。Router 会持续评估新模型,并自动将请求路由到通过质量门槛的最低成本模型。
除路由功能外,Router 还集成了 100 多种优化措施,如智能缓存、提示压缩、语义归因、Flex vs Standard 路由等,进一步降低成本和延迟。Ramp 声称路由器的可靠性达到 99.999%,每月处理超过 2.75 万亿个 Token,并且仅增加约 30 毫秒的延迟。
此外,Ramp 提供了 Token 支出管理工具,允许用户按模型、产品、团队和项目追踪每一笔 AI 调用开销,帮助企业更好地控制 AI 预算。示例显示,通过 Router 和支出管理,总支出可降低 32%,每百万 Tokens 价格降至 9 美元。
Ramp 的 AI 路由器仅需几行代码即可集成,开发者可以通过统一的 API 端点(如 curl 示例)调用多种闭源和开源模型。路由器自动处理模型选择、回退和提供商更新,让应用程序无需修改即可受益于新模型。
Ramp CTO Rahul Sengottuvelu 表示:“Router 让我们的 LLM 成本降低了 30%,同时让功能更智能、更快速。”这一工具的发布有望帮助更多企业优化 AI 工作负载的性价比。