跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

VeriPhy:用于世界模型评估与改进的智能体式物理推理系统

文章摘要

生成视频的画面流畅并不等于物理可靠,单一评分也无法说明片段违反了哪项物理约束或在哪一时刻失败。VeriPhy 是一个可审计的物理验证系统:它先用文本规划器把提示词编译为类型化物理约束和静态验证后的执行计划,再通过分割追踪、深度估计、OCR、音频事件检测等冻结专家模型收集带来源的证据记录,最终给出可追溯的 plausible/implausible/abstain 判定。在含 1500 个片段的人工标注语料上,VeriPhy 比问答分解式评估器识别出更多局部化生成缺陷,且每条结论都保留证据链,可望作为批评信号回写至生成模型。

来源arXiv Computer Vision作者: Wenzhuo Xu, Yuchen Zhu, Chongjian Ge, Xuan Shen, Jing Shi, Jason Kuen, Yongxin Chen, Molei Tao, Christopher McComb, Noelia Grande Guti\'errez, Jiuxiang Gu
VeriPhy:用于世界模型评估与改进的智能体式物理推理系统
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

如今视频生成模型可以生成看起来非常流畅的画面,但“看起来合理”并不等于符合物理规律。一个整体的画质分数也无法回答更关键的问题:一个片段到底违背了提示词中的哪项物理要求,以及它是在何时、何处开始出错的。为了把这类问题变成可验证、可追溯的过程,来自 arXiv 的新研究提出 VeriPhy,一种面向世界模型评测与改进的智能体式物理验证系统。

VeriPhy 的运行思路与直接让模型打分不同。在查看任何视频帧之前,一个纯文本规划器会先把提示词编译为带类型的物理义务,并生成一份经过静态验证的执行计划。真正执行时,系统只会根据观察结果来调度有限的底层专家工具,例如目标分割与跟踪、计数、对轨迹进行的 11 类物理量测量、深度估计、OCR 以及音频事件检测。这些专家模型是冻结的,每次调用都会返回携带来源信息的证据记录;记录中的有效负载要么是类型化测量值,要么是明确标记的学习状态。接着,类型化解析器与固定的组合规则会把这些可用的记录映射为三值状态:supported、contradicted 或 unknown,并分别呈现为 plausible、implausible 或 abstain。由于每个判定都保留完整 provenance,用户可以逐条回溯结论究竟来自哪些证据,而不是只得到一个难以解释的分数。

为了评估系统,作者构建了一个包含 1500 个视频片段的人工标注语料库,其中的缺陷记录精确标出了真实生成失败在提示词引用、空间和时间上的位置。在一个包含 149 个片段、304 条缺陷记录的核心集合上,VeriPhy 成功解释了 228 条缺陷;相比之下,一个已发表的基于问题分解的评估器在同样的片段和声明下只能解释 164 条。值得注意的是,单纯的召回率并不能把 VeriPhy 与一次性提示同一个骨干模型的方法拉开差距——后者也能达到 222 条。真正的区别在于:VeriPhy 的每一个决定都保留证据记录与 provenance,可以逐条审计,并且能够作为接口,把评论者或批评者的判定写回生成过程,用于进一步修正世界模型。

这项工作的意义不在于给出另一个“视频质量评分”,而在于建立一种可审计的中间层:它把物理常识检验拆成清晰、有类型的子任务,并用可验证的证据链连接文本提示、视频内容和最终判定。正是这种可追溯性,让生成模型不仅知道自己哪里不好,还能借助外部验证结果进行有针对性的修正,为更可靠的世界模型提供了一条实用路径。

展开要点与分析

文章情报

工程师进阶

要点

  • VeriPhy 在查看视频帧之前,将提示词编译为带类型的物理义务和经过静态验证的执行计划。
  • 执行时只调用冻结的底层专家工具,例如分割与跟踪、计数、轨迹上的 11 类物理测量、深度、OCR 和音频事件检测。
  • 每条证据都会产生带来源的记录,并被映射为 supported、contradicted 或 unknown,分别以 plausible、implausible 或 abstain 呈现。
  • 在 149 个片段、304 条缺陷记录的核心集合上,VeriPhy 解释 228 条,优于问题分解式基线的 164 条,同时保持逐条可审计的 provenance。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。