BEiTScore:基于高效交叉编码器的无参考图像描述评估方法
BEiTScore是一种基于轻量级交叉编码器的无参考图像描述评估指标,从视觉问答模型初始化,结合对抗性LLM数据增强,在保持高效性的同时实现了最先进的性能。
随着视觉语言模型(VLM)不断进步,能够生成长篇且上下文丰富的图像描述,图像描述的评估仍然是一个巨大挑战。目前最先进的评估方法主要分为两类:一类利用大语言模型(LLM)作为评判者,虽然精度高但计算成本极高,不适合大规模使用;另一类基于预训练的CLIP编码器,但存在严格的令牌长度限制(通常限制为77个token)、缺乏对细粒度视觉细节的敏感性,并且倾向于将描述视为“词袋”而忽视组合结构,导致泛化能力不足。为了克服这些局限,研究团队提出了一种名为BEiTScore的新型学习评估指标。该指标基于一个轻量级的交叉编码器,从视觉问答(VQA)模型(如BLIP-2等)的检查点进行初始化,从而获得了强大的视觉语言先验知识,同时保持了高效的推理速度。在训练阶段,BEiTScore采用精心混合的监督学习数据集,并创新性地使用了基于LLM的对抗性数据增强技术。这种增强通过使用LLM生成包含各种细粒度错误(如对象混淆、属性错误、空间关系错误等)的合成描述,迫使模型学会识别这些细微错误,从而显著提升了评估的准确性和鲁棒性。此外,该研究还引入了专为详细描述评估设计的新基准——BEiTBench,涵盖多样化场景(如复杂场景、文本丰富的图像、抽象概念等),以更全面地衡量模型性能。在多个标准基准(如COCO Captions、Flickr30k等)以及新基准上的实验表明,BEiTScore在得分与人类判断的一致性上达到了最先进水平,同时其高效性使其适用于大规模基准测试、质量感知解码以及强化学习中的奖励信号指导。该方法的另一个关键优势是其计算效率。与需要调用大型语言模型(如GPT-4)进行评分不同,BEiTScore的交叉编码器模型参数较少,推理速度更快,使其能够轻松应用于大规模评测任务,例如在训练过程中作为奖励模型指导生成,或者用于实时质量感知解码。研究团队还发现,从VQA模型初始化比从随机初始化或从图像文本匹配模型初始化效果更好,这得益于VQA任务本身对细粒度视觉理解的要求。在对抗性数据增强方面,他们使用了各类LLM(如Llama、GPT等)生成不同类型的错误描述,并通过多样化组合确保模型对常见错误模式具有敏感性。实验结果表明,与CLIPScore、BLEU等传统指标以及基于LLM的指标相比,BEiTScore在多项相关性指标(如Spearman相关系数、Kendall tau)上均取得了最优结果,同时计算开销显著低于LLM评分方法。这项研究为图像描述评估领域提供了一种高效且准确的解决方案,有望推动视觉语言模型的进一步发展。该论文由Gonçalo Gomes等三位作者完成,于2026年5月20日提交至arXiv预印本平台(编号2605.21728),研究方向包括计算机视觉(cs.CV)、计算与语言(cs.CL)以及机器学习(cs.LG)。