AI News HubLIVE
站内改写2 分钟阅读

保持一致性!利用一致性约束增强LVLM的鲁棒视觉推理

大型视觉语言模型(LVLM)在视觉推理任务中仍然脆弱。现有基准主要关注符号数学或科学问题以及简单的视觉任务,缺乏对复杂视觉推理和逻辑一致性的评估。本文提出ConVBench,一个复杂的视觉推理基准,每个图像配有两个逻辑等价的问题,涵盖六个类别。同时定义逻辑一致性和鲁棒准确性两个评估指标。进一步提出ConVLM,通过基于GRPO的强化学习结合新颖的一致性奖励来改进LVLM推理,有效利用自动生成的逻辑等价问答对和双重奖励设计。

来源arXiv Computer Vision作者: Liqiang Jing, Xiong Zhou, Siddharth Varia, Neha Anna John, Xinya Du, Vassilis N. Ioannidis

大規模視覺語言モデル(LVLM)は、画像認識や記述などの知覚タスクで優れた性能を示す一方、複雑な視覚推論においては依然として脆弱さを露呈しています。既存のベンチマークは主に記号数学や科学問題、あるいは単純な視覚タスクに焦点を当てており、信頼性の高い推論システムに不可欠な論理的一貫性の評価が不十分です。この問題に対処するため、研究チームはConVBenchを提案しました。これは複雑な視覚推論に特化した新しいベンチマークで、各画像に対して論理的に等価な2つの質問をペアとして用意します。質問は「動作と状態」「複雑な計数」「空間推論」「因果・意図理解」「常識推論」「時間知覚」の6カテゴリに分類され、モデルが同じ内容を異なる表現で問われた際に一貫した回答を生成できるかをテストします。

評価指標として、論理的一貫性(Logical Consistency)とロバスト精度(Robust Accuracy)の2つが定義されました。論理的一貫性は等価な質問ペアに対する回答の一致度を測定し、ロバスト精度は回答の正しさと一貫性を同時に評価します。これにより、モデルの真の推論能力をより正確に把握できます。

さらに、論文はConVLMという新しいフレームワークを導入します。ConVLMはグループ相対方策最適化(GRPO)に基づく強化学習を採用し、新たに設計された一貫性報酬(Consistency Reward)を組み合わせます。この報酬は自動生成された論理的に等価な質問応答ペアを活用し、正確性と一貫性の二重の信号(Dual-Reward Design)でモデルを訓練します。これにより、モデルは等価な質問に対して矛盾のない回答を生成するよう促されます。特筆すべきは、このフレームワークが厳密な正解ラベルを用いる教師あり学習と、ラベルを使用しない教師なし学習の両方で効果的に機能する点です。実験結果は、ConVLMが既存のLVLMと比較して推論のロバスト性と一貫性を大幅に向上させることを示しています。

この研究は、視覚言語モデルの信頼性向上に寄与し、自動運転や医療画像診断など、一貫性が重要な実世界アプリケーションへの応用が期待されます。