AI News HubLIVE
站內改寫2 分鐘閱讀

AI能經營食品卡車業務嗎?

FoodTruck Bench是一個AI商業模擬基準測試,考驗AI在不確定環境下持續做出商業決策的能力。測試中,AI代理管理一輛位於德克薩斯州奧斯汀的食品卡車,為期30天,需選擇地點、選單、定價、庫存和員工。排行榜顯示,Claude Opus 4.6憑藉資本配置策略領先,但三分之二的模型以破產告終。該基準測試可免費遊玩,無需註冊。

來源Hacker News AI作者: handfuloflight

FoodTruck Bench是一個創新的AI基準測試,旨在評估人工智慧在真實商業環境中的決策能力。與傳統的知識測試(如MMLU或HumanEval)不同,該基準不關注模型的知識儲備,而是考察其在不確定性下持續做出合理商業決策的能力。

在模擬中,AI代理需要管理一輛位於德克薩斯州奧斯汀的食品卡車,週期為30天。代理必須每天決定營業地點、選單設定、定價策略、庫存採購和員工招聘。每個決策都會產生連鎖反應——缺貨會導致無法營業,定價過高會流失顧客,錯誤的員工配置會降低產能。模擬不提供完美答案,而是要求代理在30天內不斷做出決策,並從結果中學習。

排行榜顯示了當前最新模型的排名。GPT-5.5以61,408美元的淨資產排名第一,投資回報率高達2970%,但執行成本也相對較高(24.32美元/次)。Claude Opus 4.6以49,519美元淨資產位居第三,但其驚人的庫存管理能力令人矚目——30天內只浪費了1.72美元的食材,而GPT-5.2的浪費量是其75倍。值得注意的是,Gemini 3 Flash因陷入無限推理迴圈而無法完成測試,而Gemma 4 26B A4B則因需要多階段JSON輸出清理才能產生有效工具呼叫而被標記。

關鍵發現揭示了AI決策中的普遍模式。庫存管理是生存最重要的預測指標:所有廢物成本低於200美元的模型都倖存下來,而所有廢物成本超過400美元的模型都破產了。員工僱傭時機同樣關鍵——倖存模型通常在第一天就僱傭員工,並在第17天前達到5人以上。早期投資卡車升級(如營銷標識、廚房裝置)也產生了複合效應,所有在第五天前升級的模型都倖存下來。

有趣的是,貸款系統不僅沒有挽救破產模型,反而加速了它們的滅亡。所有8個接受貸款的模型均以破產告終,而從未借款的4個模型全部存活。固定成本(每天55美元)無情地消耗著現金,導致被動策略無法持續。

FoodTruck Bench還提供了人類玩家與AI直接競爭的機會。任何人都可以免費遊玩,無需註冊,親自體驗模擬的難度。這種設計使得基準測試不僅是一個評估工具,也是一個教育平臺,讓人們直觀感受AI在真實商業環境中的表現。

該專案已測試了38個模型,包括30天的模擬週期、34個代理工具和6個地點選項。所有測試使用相同的種子、天氣、事件、競爭對手和市場條件,確保唯一的變數是模型自身的決策。每個模型執行5次,選擇中位數表現進行排名。

FoodTruck Bench的建立者強調,該基準測試填補了現有評估體系的空白——知道與做到是兩種不同的技能。透過這個模擬,他們希望推動AI在複雜、動態環境中的決策能力發展。