手写编辑基准测试:Fable 5 排名第一,Opus 4.8 在计数错误上退步 55%
该基准测试要求模型识别扫描页面上的手写编辑标记,并输出结构化JSON。任务涉及插入、删除、替换等六种编辑类型,结合视觉识别与语言理解。
近日,一个名为“Handwritten-edit benchmark”的新基准测试正式发布,旨在评估AI模型识别和解释手写编辑标记的能力。该测试要求模型处理带有手写注释的扫描页面,并将这些编辑转换为结构化的JSON格式。任务不仅要求检测编辑的存在,还需明确编辑类型、原始文本、修正后的文本、所在行号以及页面标识。编辑类型共分为六种:插入、删除、替换、标点、大小写和斜体。模型需要根据视觉线索,如插入符号(^)、删除线、圆圈等,推断作者的意图。例如,插入通过脱字符表示,删除通过删除线体现,替换则常见于圈出或下划线的文本旁附有替换内容。这些操作融合了精细的视觉识别与自然语言理解。
在初步评估中,Fable 5模型取得了最高分数,而Opus 4.8则在计数错误方面表现不佳,相比前代版本退步了55%。这一结果突显了手写编辑理解任务的挑战性,尤其是处理细微视觉标记时的困难。基准测试的样例页面取自狄更斯的经典小说《小杜丽》,展示了真实世界的编辑场景。该基准测试有望推动AI在文档理解、数字人文和自动校对等领域的发展。未来的模型需要更全面地结合视觉与语言线索,才能准确还原手写编辑的意图,实现真正的上下文理解。