AI News HubLIVE
サイト内リライト2 分で読了

AIはフードトラックビジネスを運営できるか?

FoodTruck Benchは、不確実性の下での一貫したビジネス意思決定能力をテストするAIベンチマークです。AIエージェントはテキサス州オースティンで30日間フードトラックを運営し、場所、メニュー、価格設定、在庫、スタッフを決定します。リーダーボードではClaude Opus 4.6が資本配分スキルでトップですが、モデルの3分の2が破産します。このベンチマークは無料でプレイ可能です。

ソースHacker News AI著者: handfuloflight

FoodTruck Benchは、AIの実用的な意思決定能力を評価するための革新的なベンチマークです。従来の知識テスト(MMLUやHumanEvalなど)とは異なり、このベンチマークはモデルの知識量ではなく、不確実性の中で持続的にビジネス上の意思決定を行う能力を測定します。

シミュレーションでは、AIエージェントがテキサス州オースティンでフードトラックを30日間運営します。エージェントは毎日、営業場所、メニュー設定、価格戦略、在庫購入、従業員雇用を決定する必要があります。各決定は連鎖反応を引き起こします——在庫切れは営業不能に、価格の高さは顧客離れに、不適切な人員配置は生産能力低下につながります。シミュレーションは完璧な答えを求めず、30日間にわたる一連の不完全な決断とその結果を重視します。

リーダーボードは最新モデルのランキングを示しています。GPT-5.5は61,408ドルの純資産でトップ、ROIは2970%に達しますが、実行コストも高めです(24.32ドル/回)。Claude Opus 4.6は49,519ドルの純資産で3位ですが、その驚異的な在庫管理能力が際立ちます——30日間でわずか1.72ドルの食材廃棄、一方でGPT-5.2ではその75倍もの廃棄が発生しました。注目すべきは、Gemini 3 Flashが無限の推論ループに陥りテストを完了できなかったこと、そしてGemma 4 26B A4Bは有効なツール呼び出しを生成するために多段階のJSON出力修正を必要としたことです。

主要な発見はAI意思決定の一般的なパターンを明らかにしました。在庫管理は生存の最も重要な予測因子です:廃棄コストが200ドル未満のモデルはすべて生き残り、400ドルを超えるモデルはすべて破産しました。従業員の雇用タイミングも同様に重要で、生存モデルは通常1日目に最初のスタッフを雇い、17日目までに5人以上に増やしました。初期のトラックアップグレード(マーケティング看板、厨房機器、能力向上)への投資も複合効果を生み、5日目までにアップグレードしたモデルはすべて生き残りました。

興味深いことに、ローンシステムは破産したモデルを救うどころか、破産を加速させました。ローンを組んだ8モデルすべてが破産し、ローンを組まなかった4モデルはすべて生存しました。固定費(日額55ドル)が容赦なく現金を消耗し、受動的な戦略は持続不可能です。

FoodTruck Benchは、人間のプレイヤーがAIと直接競争する機会も提供しています。誰でも無料でプレイでき、登録不要でシミュレーションの難しさを体感できます。この設計により、ベンチマークは評価ツールであるだけでなく、教育プラットフォームとしても機能し、現実のビジネス環境におけるAIのパフォーマンスを直感的に理解させます。

このプロジェクトはすでに38モデルをテストし、30日間のシミュレーション、34のエージェントツール、6つのロケーションオプションを含んでいます。すべてのテストは同一のシード、天候、イベント、競合他社、市場条件で行われ、唯一の変数はモデル自身の意思決定です。各モデルは5回実行され、中央値のパフォーマンスがランキングに使用されます。

FoodTruck Benchの作成者は、このベンチマークが既存の評価体系のギャップ——知識と実行は異なるスキルであること——を埋めると強調しています。このシミュレーションを通じて、複雑で動的な環境におけるAIの意思決定能力の向上を促進することを目指しています。