AI News HubLIVE
站内改写1 分钟阅读

编码智能体解决ARC-AGI-3是否需要可执行世界模型、简化和验证?

一项新研究通过四种嵌套的Codex智能体实验,揭示了可执行世界模型、计划性简化和精确回放验证在ARC-AGI-3任务中的贡献。结果表明,更强的模型和更高的推理努力始终提升性能,但各组件效果因设置而异,完整的验证处理表现最佳但资源消耗大。

来源arXiv AI作者: Sergey Rodionov

一篇新发表的论文探讨了编码智能体在解决ARC-AGI-3任务时,是否需要可执行世界模型、计划性简化和精确回放验证。该研究由Sergey Rodionov完成,旨在阐明之前一个整合了这三种技术的智能体中,究竟是哪些组件贡献了其性能。

研究者设计了四种基于Codex的智能体:文本基线、无回放验证的可执行世界模型、带计划性简化的可执行模型,以及保留简化并要求精确回放观察的完整验证处理。主要实验使用gpt-5.4和gpt-5.5在高与超高推理努力下评估所有四种智能体在公开ARC-AGI-3游戏上的表现。探索性后续实验则使用gpt-5.6-sol在超高和最高推理努力下评估文本和验证变体。

最稳健的结果是,所有智能体变体都随着模型更强和推理努力增加而提升。在每个模型-努力设定内,变体间的差异小于预期,而各组件的效果则因设定而异。要求持久可执行交付并非普遍有益:在两种gpt-5.5设定中,文本基线都优于灵活接口的可执行变体。简化在四个模型-努力设定中的三个提升了性能,仅在最弱设定中例外。完整验证处理在所有四个设定中排名第一,但消耗了更多资源。

在gpt-5.6-sol的后续实验中,验证变体在两种推理努力下完全解决了所有公开游戏,达到了约99%的RHAE,且总动作数不到人类基线的一半。由于该模型在这些游戏之后发布,且未见数据的性能尚未测试,这一结果应仅视为公开集的饱和现象。该研究强调了模型强度和推理努力的重要性,同时指出不同组件在不同条件下的差异化效果,为未来智能体设计提供了重要参考。