BEiTScore:基於高效交叉編碼器的無參考圖像描述評估方法
BEiTScore是一種基於輕量級交叉編碼器的無參考圖像描述評估指標,從視覺問答模型初始化,結合對抗性LLM數據增強,在保持高效性的同時實現了最先進的性能。
隨着視覺語言模型(VLM)不斷進步,能夠生成長篇且上下文豐富的圖像描述,圖像描述的評估仍然是一個巨大挑戰。目前最先進的評估方法主要分為兩類:一類利用大語言模型(LLM)作為評判者,雖然精度高但計算成本極高,不適合大規模使用;另一類基於預訓練的CLIP編碼器,但存在嚴格的令牌長度限制(通常限制為77個token)、缺乏對細粒度視覺細節的敏感性,並且傾向於將描述視為“詞袋”而忽視組合結構,導致泛化能力不足。為了克服這些侷限,研究團隊提出了一種名為BEiTScore的新型學習評估指標。該指標基於一個輕量級的交叉編碼器,從視覺問答(VQA)模型(如BLIP-2等)的檢查點進行初始化,從而獲得了強大的視覺語言先驗知識,同時保持了高效的推理速度。在訓練階段,BEiTScore採用精心混合的監督學習數據集,並創新性地使用了基於LLM的對抗性數據增強技術。這種增強通過使用LLM生成包含各種細粒度錯誤(如對象混淆、屬性錯誤、空間關係錯誤等)的合成描述,迫使模型學會識別這些細微錯誤,從而顯著提升了評估的準確性和魯棒性。此外,該研究還引入了專為詳細描述評估設計的新基準——BEiTBench,涵蓋多樣化場景(如複雜場景、文本豐富的圖像、抽象概念等),以更全面地衡量模型性能。在多個標準基準(如COCO Captions、Flickr30k等)以及新基準上的實驗表明,BEiTScore在得分與人類判斷的一致性上達到了最先進水平,同時其高效性使其適用於大規模基準測試、質量感知解碼以及強化學習中的獎勵信號指導。該方法的另一個關鍵優勢是其計算效率。與需要調用大型語言模型(如GPT-4)進行評分不同,BEiTScore的交叉編碼器模型參數較少,推理速度更快,使其能夠輕鬆應用於大規模評測任務,例如在訓練過程中作為獎勵模型指導生成,或者用於實時質量感知解碼。研究團隊還發現,從VQA模型初始化比從隨機初始化或從圖像文本匹配模型初始化效果更好,這得益於VQA任務本身對細粒度視覺理解的要求。在對抗性數據增強方面,他們使用了各類LLM(如Llama、GPT等)生成不同類型的錯誤描述,並通過多樣化組合確保模型對常見錯誤模式具有敏感性。實驗結果表明,與CLIPScore、BLEU等傳統指標以及基於LLM的指標相比,BEiTScore在多項相關性指標(如Spearman相關係數、Kendall tau)上均取得了最優結果,同時計算開銷顯著低於LLM評分方法。這項研究為圖像描述評估領域提供了一種高效且準確的解決方案,有望推動視覺語言模型的進一步發展。該論文由Gonçalo Gomes等三位作者完成,於2026年5月20日提交至arXiv預印本平台(編號2605.21728),研究方向包括計算機視覺(cs.CV)、計算與語言(cs.CL)以及機器學習(cs.LG)。