編碼智慧體解決ARC-AGI-3是否需要可執行世界模型、簡化和驗證?
一項新研究透過四種巢狀的Codex智慧體實驗,揭示了可執行世界模型、計劃性簡化和精確回放驗證在ARC-AGI-3任務中的貢獻。結果表明,更強的模型和更高的推理努力始終提升效能,但各元件效果因設定而異,完整的驗證處理表現最佳但資源消耗大。
一篇新發表的論文探討了編碼智慧體在解決ARC-AGI-3任務時,是否需要可執行世界模型、計劃性簡化和精確回放驗證。該研究由Sergey Rodionov完成,旨在闡明之前一個整合了這三種技術的智慧體中,究竟是哪些元件貢獻了其效能。
研究者設計了四種基於Codex的智慧體:文本基線、無回放驗證的可執行世界模型、帶計劃性簡化的可執行模型,以及保留簡化並要求精確回放觀察的完整驗證處理。主要實驗使用gpt-5.4和gpt-5.5在高與超高推理努力下評估所有四種智慧體在公開ARC-AGI-3遊戲上的表現。探索性後續實驗則使用gpt-5.6-sol在超高和最高推理努力下評估文本和驗證變體。
最穩健的結果是,所有智慧體變體都隨著模型更強和推理努力增加而提升。在每個模型-努力設定內,變體間的差異小於預期,而各元件的效果則因設定而異。要求持久可執行交付並非普遍有益:在兩種gpt-5.5設定中,文本基線都優於靈活介面的可執行變體。簡化在四個模型-努力設定中的三個提升了效能,僅在最弱設定中例外。完整驗證處理在所有四個設定中排名第一,但消耗了更多資源。
在gpt-5.6-sol的後續實驗中,驗證變體在兩種推理努力下完全解決了所有公開遊戲,達到了約99%的RHAE,且總動作數不到人類基線的一半。由於該模型在這些遊戲之後釋出,且未見資料的效能尚未測試,這一結果應僅視為公開集的飽和現象。該研究強調了模型強度和推理努力的重要性,同時指出不同元件在不同條件下的差異化效果,為未來智慧體設計提供了重要參考。