如今视频生成模型可以生成看起来非常流畅的画面,但“看起来合理”并不等于符合物理规律。一个整体的画质分数也无法回答更关键的问题:一个片段到底违背了提示词中的哪项物理要求,以及它是在何时、何处开始出错的。为了把这类问题变成可验证、可追溯的过程,来自 arXiv 的新研究提出 VeriPhy,一种面向世界模型评测与改进的智能体式物理验证系统。
VeriPhy 的运行思路与直接让模型打分不同。在查看任何视频帧之前,一个纯文本规划器会先把提示词编译为带类型的物理义务,并生成一份经过静态验证的执行计划。真正执行时,系统只会根据观察结果来调度有限的底层专家工具,例如目标分割与跟踪、计数、对轨迹进行的 11 类物理量测量、深度估计、OCR 以及音频事件检测。这些专家模型是冻结的,每次调用都会返回携带来源信息的证据记录;记录中的有效负载要么是类型化测量值,要么是明确标记的学习状态。接着,类型化解析器与固定的组合规则会把这些可用的记录映射为三值状态:supported、contradicted 或 unknown,并分别呈现为 plausible、implausible 或 abstain。由于每个判定都保留完整 provenance,用户可以逐条回溯结论究竟来自哪些证据,而不是只得到一个难以解释的分数。
为了评估系统,作者构建了一个包含 1500 个视频片段的人工标注语料库,其中的缺陷记录精确标出了真实生成失败在提示词引用、空间和时间上的位置。在一个包含 149 个片段、304 条缺陷记录的核心集合上,VeriPhy 成功解释了 228 条缺陷;相比之下,一个已发表的基于问题分解的评估器在同样的片段和声明下只能解释 164 条。值得注意的是,单纯的召回率并不能把 VeriPhy 与一次性提示同一个骨干模型的方法拉开差距——后者也能达到 222 条。真正的区别在于:VeriPhy 的每一个决定都保留证据记录与 provenance,可以逐条审计,并且能够作为接口,把评论者或批评者的判定写回生成过程,用于进一步修正世界模型。
这项工作的意义不在于给出另一个“视频质量评分”,而在于建立一种可审计的中间层:它把物理常识检验拆成清晰、有类型的子任务,并用可验证的证据链连接文本提示、视频内容和最终判定。正是这种可追溯性,让生成模型不仅知道自己哪里不好,还能借助外部验证结果进行有针对性的修正,为更可靠的世界模型提供了一条实用路径。