AI News HubLIVE
站内改写3 分钟阅读

多模态评估器:Strands Evals 中图像到文本任务的 MLLM 作为裁判

Strands Evals 推出了四种新的多模态大语言模型(MLLM)评估器,用于图像到文本任务的整体质量、正确性、忠实度和指令遵循。这些评估器直接将图像发送给多模态裁判模型,返回基于图像的分值和推理字符串,可用于持续集成以捕获视觉幻觉、事实错误和指令违规。本文还介绍了如何设置这些评估器、使用参考和免参考模式、自定义评估标准以及选择裁判模型。

来源AWS Machine Learning Blog作者: Sangmin Woo

在构建视觉购物、图像或文档理解以及图表分析等应用时,验证模型输出是否基于源图像至关重要。传统的纯文本评估器无法判断描述是否准确反映图像、提取的发票总额是否与文档一致,或屏幕摘要是否凭空捏造了页面上的按钮。Gartner预测,到2030年,80%的企业软件将具有多模态能力,而2024年这一比例不到10%。没有自动化的多模态评估,开发者只能依赖昂贵的人工审核或不可靠的文本代理。

今日,Strands Evals SDK推出了四种新的多模态大语言模型(MLLM)评估器:整体质量、正确性、忠实度和指令遵循。每个评估器对图像到文本的输出进行评分,直接向多模态裁判模型发送图像以及查询、响应和可选的参考答案。裁判模型返回基于图像的分值和推理字符串,可用于调试。这些评估器可无缝替换文本评估器,并集成到持续集成(CI)中,自动捕获视觉幻觉、事实错误和指令违规。

本文将介绍如何设置这四种多模态评估器并在图像到文本任务上运行它们;如何在相同评估器上切换参考和免参考模式;编写针对特定领域的自定义多模态评估标准;选择亚马逊Bedrock上平衡准确性、成本和延迟的裁判模型;以及应用提示设计选择,以提高裁判与人类评分的一致性。

接下来是前提条件(Python 3.10以上、安装相应库、AWS账号等)。然后解释为什么纯文本裁判会遗漏基于图像的失败:例如模型自信地描述图表中并不存在的趋势、幻觉出图片中没有的产品或人物、回答错误问题或格式不当。纯文本裁判只阅读输出而不验证图像,因此无法发现这些问题。

四种评估器针对最常用的多模态类别——输入为图像(或文档图像)加文本,输出为文本。这包括图像字幕、视觉问答、图表信息图解释、文档字段提取、OCR和屏幕截图摘要。表格总结了四种评估器及其捕获的内容:

  • 整体质量(Likert 1-5):回答的整体质量如何?捕获相关性差、不准确、回答浅薄、不全面。
  • 正确性(二值):回答在图像和查询下是否事实正确且完整?捕获事实错误、属性、计数、位置、遗漏。
  • 忠实度(二值):回答是否基于图像而无幻觉?捕获虚构对象、无依据推断、外部知识泄漏。
  • 指令遵循(二值):回答是否遵循查询约束?捕获格式违规、计数错误、离题内容、忽略范围。

每种评估器支持两种模式:参考模式(对比黄金答案)和免参考模式(仅从图像判断),后者适用于实时图像无地面真值情况。

接下来是端到端演练:评估一个图表阅读任务。输入是一张条形图,显示各区域每月付费流媒体会员的平均收入。系统是一个简单的视觉智能体,回答关于图表的狭窄问题。四种评估器在同一个实验中使用,共享MultimodalOutputEvaluator基类并通过ImageData接收图像。 步骤1:定义案例和评估器。案例封装图像和指令到MultimodalInput中,提供expected_output激活参考模式。 步骤2:编写任务函数并运行实验。任务函数接收案例,运行视觉模型返回响应字符串。 步骤3:检查报告。报告包含每个案例的分数、测试通过状态和推理字符串。示例输出显示了所有评估器通过的情况,并给出了推理字符串。注意每个评估器都返回推理字符串,这对于调试至关重要。同一案例在单个实验中被四个独立裁判评分。

自定义评估标准:基类接受任意rubric字符串,例如用于医学诊断准确性的评分标准。 最后,从实验中得出的三个设计问题:

  1. 裁判需要看到图像吗?实验表明,多模态裁判(图像+文本)比纯文本裁判(即使配有详细图像描述)更接近人类评分。而且生成图像描述额外调用LLM并不明显更便宜或更快。
  2. 在亚马逊Bedrock上选择哪个模型作为裁判?比较后,Anthropic Claude Sonnet 4.6提供了最佳的准确性与成本平衡,并作为默认。总体观察:更大、更具推理能力的模型作为裁判更可靠,而在同等级别中,高端模型并未比中端模型获得显著更高的准确性。
  3. 提示设计:提示设计选择如何影响裁判与人类的一致性?实验中的最佳实践包括:明确要求裁判基于图像证据进行评分,提供清晰的评分标准,并要求输出推理过程。

通过自动化的多模态评估,开发者可以构建更可靠的视觉AI应用,减少手动审核需求。