AI News HubLIVE
サイト内リライト2 分で読了

BEiTScore:効率的なクロスエンコーダモデルを用いた参照なし画像キャプション評価

BEiTScoreは、VQAモデルのチェックポイントから初期化された軽量クロスエンコーダに基づく新しい参照なし画像キャプション評価指標であり、敵対的LLMデータ拡張を用いて、高い効率性を維持しながら最先端の性能を達成する。

ソースarXiv Computer Vision著者: Gon\c{c}alo Gomes, Bruno Martins, Chrysoula Zerva

視覚言語モデルがより長く文脈に富んだ記述を生成する能力へと進化するにつれて、画像キャプションの評価は依然として重要な課題です。最先端の評価指標は、大規模言語モデル(LLM)を判定子として利用することに伴う多大な計算コストを要するか、または標準的なCLIPベースのエンコーダの制限(厳格なトークン制限、細粒度感度の欠如、キャプションを「bag-of-words」として扱うことによる構成的一般化の欠如など)に悩まされています。本研究では、これらの課題に取り組む新しい学習ベースの指標BEiTScoreを提案します。これは、視覚質問応答(VQA)モデル(例:BLIP-2など)のチェックポイントから初期化された軽量クロスエンコーダに基づいており、強力な重み初期化と計算効率のバランスを取ります。トレーニング手法では、注意深く構成されたデータ混合を使用した教師あり学習に加え、敵対的LLMベースのデータ拡張を導入し、細粒度の視覚言語エラーに対するモデルの感度を高めます。このデータ拡張では、LLM(Llama、GPTなど)を使用して、オブジェクトの混同、属性の誤り、空間関係の誤りなど、さまざまな種類の細かいエラーを含む合成キャプションを生成し、モデルがこれらのエラーを識別することを強制します。また、多様なシナリオ(複雑なシーン、テキスト豊富な画像、抽象概念など)にわたる詳細なキャプション評価を評価するための新しいベンチマークBEiTBenchも提案しています。COCO Captions、Flickr30kなどの標準ベンチマークおよび新しいベンチマークでの実験結果は、BEiTScoreが人間の判断との一致において最先端の性能を達成し、同時に大規模ベンチマーク、品質認識デコーディング、または強化学習における報酬信号としての使用に必要な効率性を維持することを示しています。この方法のもう一つの重要な利点は計算効率です。LLM(GPT-4など)を呼び出す必要があるスコアリングとは異なり、BEiTScoreのクロスエンコーダはパラメータが少なく、推論が高速であり、大規模な評価タスク(トレーニング中の報酬モデルとしての使用やリアルタイムの品質認識デコーディングなど)に容易に適用できます。研究チームはまた、VQAからの初期化がランダム初期化や画像テキストマッチングモデルからの初期化よりも優れていることを発見しました。これはVQAタスク自体が細粒度の視覚理解を必要とするためです。実験では、CLIPScore、BLEUなどの従来指標およびLLMベースの指標と比較して、BEiTScoreはSpearman相関係数やKendall tauなどの複数の相関指標で最良の結果を達成し、計算コストはLLMスコアリング手法よりも大幅に低くなりました。この研究は、画像キャプション評価の分野に効率的かつ正確なソリューションを提供し、視覚言語モデルのさらなる発展を促進することが期待されます。本論文はGonçalo Gomesら3名の著者によって執筆され、2026年5月20日にarXiv(識別子2605.21728)に投稿されました。対象分野はコンピュータビジョン(cs.CV)、計算言語学(cs.CL)、機械学習(cs.LG)です。