Launch HN: Tokenless (YC S26) – 自動モデル切り替えによるコスト削減
Tokenless は、複数のモデルにリクエストを並列送信し、正しい回答を得たモデルだけを選択して他をキャンセルすることで、AI推論コストを半減しつつ品質を維持するスマートルーターです。
Tokenless は、大規模言語モデル(LLM)の推論コストを劇的に削減する新しいAIモデルルーターです。OpenAIおよびAnthropicのAPI形式と完全に互換性のあるエンドポイントを提供するため、既存のアプリケーションにコード変更を加えることなく統合できます。その仕組みは、リクエストを受け取ると同時に複数のモデル(オープンソースモデルやクローズドモデルを含む)にタスクを並列送信し、各モデルの思考過程を監視するというものです。いずれかのモデルが正しい解答に到達したと判断された時点で、そのモデルを選択し、他のすべてのモデルへのリクエストを即座にキャンセルします。これにより、ユーザーは最終的に使用したモデルの料金のみを支払うことになり、不必要なコストを回避できます。
Tokenless の有効性は、公開されたコーディングベンチマークで実証されています。TerminalBench 2.1では、PROモードがOpus 4.8と同じ解決率72%を達成しながら、タスクあたりのコストは0.32ドルと、Opus 4.8の2.41ドルから57%削減されました。LiveCodeBenchでは、PROモードの解決率は89.0%で、GPT 5.5の85.7%を上回り、総コストも低く抑えられています。最高品質を求めるユーザー向けには、各タスクに最適なモデルを自動選択するMAXモードも用意されており、TerminalBenchでは82%の解決率を達成しています。これらの結果は、Tokenlessが品質を維持しながらコストを大幅に削減できることを示しています。
Tokenless は、コスト削減シミュレーターも提供しており、ユーザーは現在の月間LLM支出を入力することで、導入による節約額を推定できます。例えば、現在月額40,000ドルをAI推論に費やしている場合、Tokenlessを使用することで月額26,000ドルに削減でき、節約率は34%と見積もられています。この推定は公開トークン価格と調整可能なルーティング仮定に基づいており、実際の節約額はユーザーのトラフィックパターンに依存します。また、Ramp AI Indexによれば、AI支出は月間約11%の成長率を示しており、長期的な節約効果はさらに大きくなる可能性があります。
Tokenless は、Google DeepMind、プリンストン大学、カリフォルニア大学バークレー校出身のAI研究者によって開発され、Y Combinatorの支援を受けています。同社は無料のデモを提供しており、ユーザーは実際のトラフィックデータを提出することで、カスタマイズされた節約レポートを受け取ることができます。Tokenless の目標は、AI推論のデフォルトルーターとなることであり、すべてのリクエストを最適なモデルに自動的にルーティングし、品質を犠牲にすることなくコスト効率を最大化することです。