AI News HubLIVE
站内改写1 分钟阅读

多样性重于频率:重新思考视觉思维链代理中的工具使用

本文研究了视觉代理在复杂推理任务中工具使用的现象,发现“工具使用崩塌”——模型随着训练逐渐停止使用工具但准确性却提高。作者提出通过熵正则化鼓励多样化探索,获得最佳性能,表明工具应作为训练时的支架而非最终依赖。

来源arXiv Computer Vision作者: Dong-Hee Kim, Reuben Tan, Donghyun Kim

在人工智能领域,视觉推理代理通常依赖外部工具来获取细粒度证据,但近期一项研究对这一传统做法提出了深刻质疑。来自ICML 2026的一篇论文通过系统实验发现,在复杂的视觉推理任务中,模型在训练过程中会逐渐停止使用外部工具,然而其任务准确性却持续提升。作者将这一现象命名为“工具使用崩塌”(tool-use collapse)。

研究团队超越了简单的视觉搜索任务,将目光投向更具挑战性的3D空间推理和医学视觉问答(Medical VQA)场景。在这些任务中,代理需要将工具获取的局部证据与全局上下文进行整合,对推理能力要求更高。实验结果表明,完全禁用工具会导致性能显著下降,显示工具在初期的重要性;然而,如果通过奖励等方式激励模型更多使用工具,虽然工具调用次数大幅上升,性能提升却微乎其微,仅获得边际收益。这种不对称性令人深思。

进一步分析揭示了背后的原因:无论是标准的监督训练还是特意鼓励工具使用,都会降低模型在推理路径(rollout)上的多样性。而正是这种多样性的缺失,解释了为何更高的工具使用率并未带来更强的推理性能。基于此洞察,研究人员设计了熵正则化项,旨在鼓励模型在推理过程中进行更多样化的探索。实验结果显示,尽管采用该方法后工具使用率逐步下降,但模型取得了最佳的整体性能。

这项研究的核心启示是:在训练阶段,工具应被视作一种“脚手架”(scaffolding),其价值在于帮助模型在推理早期进行更广泛的探索——包括语言生成和视觉工具调用——从而提升推理能力,而最终的部署阶段未必需要依赖大量工具调用。论文已在机器学习顶级会议ICML 2026上发表,项目页面提供了更多实现细节,网址为 https://scaffolded-exploration.github.io。这一发现为视觉语言模型的设计和训练提供了新的方向,强调多样性而非频率,或将推动未来AI代理更加高效和智能。