AI News HubLIVE
站內改寫1 分鐘閱讀

多樣性重於頻率:重新思考視覺思維鏈代理中的工具使用

本文研究了視覺代理在複雜推理任務中工具使用的現象,發現“工具使用崩塌”——模型隨著訓練逐漸停止使用工具但準確性卻提高。作者提出透過熵正則化鼓勵多樣化探索,獲得最佳效能,表明工具應作為訓練時的支架而非最終依賴。

來源arXiv Computer Vision作者: Dong-Hee Kim, Reuben Tan, Donghyun Kim

在人工智慧領域,視覺推理代理通常依賴外部工具來獲取細粒度證據,但近期一項研究對這一傳統做法提出了深刻質疑。來自ICML 2026的一篇論文透過系統實驗發現,在複雜的視覺推理任務中,模型在訓練過程中會逐漸停止使用外部工具,然而其任務準確性卻持續提升。作者將這一現象命名為“工具使用崩塌”(tool-use collapse)。

研究團隊超越了簡單的視覺搜尋任務,將目光投向更具挑戰性的3D空間推理和醫學視覺問答(Medical VQA)場景。在這些任務中,代理需要將工具獲取的區域性證據與全域性上下文進行整合,對推理能力要求更高。實驗結果表明,完全停用工具會導致效能顯著下降,顯示工具在初期的重要性;然而,如果透過獎勵等方式激勵模型更多使用工具,雖然工具呼叫次數大幅上升,效能提升卻微乎其微,僅獲得邊際收益。這種不對稱性令人深思。

進一步分析揭示了背後的原因:無論是標準的監督訓練還是特意鼓勵工具使用,都會降低模型在推理路徑(rollout)上的多樣性。而正是這種多樣性的缺失,解釋了為何更高的工具使用率並未帶來更強的推理效能。基於此洞察,研究人員設計了熵正則化項,旨在鼓勵模型在推理過程中進行更多樣化的探索。實驗結果顯示,儘管採用該方法後工具使用率逐步下降,但模型取得了最佳的整體效能。

這項研究的核心啟示是:在訓練階段,工具應被視作一種“腳手架”(scaffolding),其價值在於幫助模型在推理早期進行更廣泛的探索——包括語言生成和視覺工具呼叫——從而提升推理能力,而最終的部署階段未必需要依賴大量工具呼叫。論文已在機器學習頂級會議ICML 2026上發表,專案頁面提供了更多實現細節,網址為 https://scaffolded-exploration.github.io。這一發現為視覺語言模型的設計和訓練提供了新的方向,強調多樣性而非頻率,或將推動未來AI代理更加高效和智慧。