AI News HubLIVE
站内改写2 分钟阅读

AI能经营食品卡车业务吗?

FoodTruck Bench是一个AI商业模拟基准测试,考验AI在不确定环境下持续做出商业决策的能力。测试中,AI代理管理一辆位于德克萨斯州奥斯汀的食品卡车,为期30天,需选择地点、菜单、定价、库存和员工。排行榜显示,Claude Opus 4.6凭借资本配置策略领先,但三分之二的模型以破产告终。该基准测试可免费游玩,无需注册。

来源Hacker News AI作者: handfuloflight

FoodTruck Bench是一个创新的AI基准测试,旨在评估人工智能在真实商业环境中的决策能力。与传统的知识测试(如MMLU或HumanEval)不同,该基准不关注模型的知识储备,而是考察其在不确定性下持续做出合理商业决策的能力。

在模拟中,AI代理需要管理一辆位于德克萨斯州奥斯汀的食品卡车,周期为30天。代理必须每天决定营业地点、菜单设置、定价策略、库存采购和员工招聘。每个决策都会产生连锁反应——缺货会导致无法营业,定价过高会流失顾客,错误的员工配置会降低产能。模拟不提供完美答案,而是要求代理在30天内不断做出决策,并从结果中学习。

排行榜显示了当前最新模型的排名。GPT-5.5以61,408美元的净资产排名第一,投资回报率高达2970%,但运行成本也相对较高(24.32美元/次)。Claude Opus 4.6以49,519美元净资产位居第三,但其惊人的库存管理能力令人瞩目——30天内只浪费了1.72美元的食材,而GPT-5.2的浪费量是其75倍。值得注意的是,Gemini 3 Flash因陷入无限推理循环而无法完成测试,而Gemma 4 26B A4B则因需要多阶段JSON输出清理才能产生有效工具调用而被标记。

关键发现揭示了AI决策中的普遍模式。库存管理是生存最重要的预测指标:所有废物成本低于200美元的模型都幸存下来,而所有废物成本超过400美元的模型都破产了。员工雇佣时机同样关键——幸存模型通常在第一天就雇佣员工,并在第17天前达到5人以上。早期投资卡车升级(如营销标识、厨房设备)也产生了复合效应,所有在第五天前升级的模型都幸存下来。

有趣的是,贷款系统不仅没有挽救破产模型,反而加速了它们的灭亡。所有8个接受贷款的模型均以破产告终,而从未借款的4个模型全部存活。固定成本(每天55美元)无情地消耗着现金,导致被动策略无法持续。

FoodTruck Bench还提供了人类玩家与AI直接竞争的机会。任何人都可以免费游玩,无需注册,亲自体验模拟的难度。这种设计使得基准测试不仅是一个评估工具,也是一个教育平台,让人们直观感受AI在真实商业环境中的表现。

该项目已测试了38个模型,包括30天的模拟周期、34个代理工具和6个地点选项。所有测试使用相同的种子、天气、事件、竞争对手和市场条件,确保唯一的变量是模型自身的决策。每个模型运行5次,选择中位数表现进行排名。

FoodTruck Bench的创建者强调,该基准测试填补了现有评估体系的空白——知道与做到是两种不同的技能。通过这个模拟,他们希望推动AI在复杂、动态环境中的决策能力发展。