AI News HubLIVE
站内改写2 分钟阅读

Launch HN: Tokenless (YC S26) – 自动模型切换,节省AI推理成本

Tokenless 是一个智能路由器,它通过并行向多个模型发送请求并选择最佳结果,自动取消其他模型,从而将AI推理成本降低一半,同时保持输出质量。

来源Hacker News AI作者: rohaga

Tokenless 是一款创新的AI模型路由器,专为降低大型语言模型的推理成本而设计。它作为一个即插即用的API端点,完全兼容OpenAI和Anthropic的调用格式,用户只需将现有的API地址替换为Tokenless的端点,即可立即开始使用,无需修改任何代码。其核心工作原理是智能并行调度:当收到一个请求时,Tokenless会同时向一组经过精心挑选的模型(包括开源和闭源模型)发送相同的任务,并实时监控每个模型的推理进度。一旦某个模型展现出清晰的解决路径,系统会立即选择该模型作为最终输出,并自动取消其他所有正在处理的请求。这意味着用户只需为最终使用的模型付费,而避免了为简单任务支付前沿模型的高昂开销。

Tokenless 的实际效果已经在公开的编码基准测试中得到了验证。在TerminalBench 2.1测试中,Tokenless的PRO模式以72%的解决率达到了与Opus 4.8相同的质量水平,但每任务成本仅为0.32美元,相比Opus 4.8的2.41美元降低了57%。在LiveCodeBench测试中,PRO模式以89.0%的解决率略高于GPT 5.5的85.7%,同时总成本更低。对于追求最高质量的用户,Tokenless还提供了MAX模式,该模式会为每个任务自动选择当前可用的最佳模型,虽然成本较高,但能获得更高的解决率(TerminalBench上为82%)。这些数据清楚地表明,Tokenless能够在保持输出质量的前提下显著降低推理成本。

除了基准测试,Tokenless还提供了一个成本模拟器,允许用户输入自己的月度LLM支出,从而估算通过使用Tokenless可以节省的费用。例如,如果一个用户当前每月支付40,000美元的AI推理费用,Tokenless预计可以将其降至26,000美元,节省率达34%。这个估算基于公开的token价格和可调的路由假设,实际节省取决于用户的流量模式。此外,Tokenless还参考了Ramp AI Index的支出趋势,该指数显示AI支出每月增长约11%,因此长期节省潜力更大。

Tokenless 的团队由来自Google DeepMind、普林斯顿大学和加州大学伯克利分校的AI研究员组成,他们已经获得了Y Combinator的种子轮投资。公司提供免费的演示服务,用户可以通过提交实际流量数据来获得定制化的节省报告。Tokenless的目标是成为AI推理的默认路由器,让每个请求都能自动匹配最合适的模型,从而在不牺牲质量的前提下最大化成本效益。