コーディングエージェントはARC-AGI-3を解くために実行可能な世界モデル、単純化、検証を必要とするか?
新しい研究では、4つのネストされたCodexベースのエージェント実験を通じて、実行可能な世界モデル、計画的な単純化、正確な再生検証がARC-AGI-3タスクにどのように貢献するかを明らかにした。結果は、より強力なモデルと高い推論努力が常に性能を向上させるが、各コンポーネントの効果は設定によって異なり、完全な検証処理が最も性能が高いがリソースを多く消費することを示している。
新しい研究論文が、コーディングエージェントがARC-AGI-3タスクを解決する際に、実行可能な世界モデル、計画的な単純化、正確な再生検証を必要とするかどうかを検討している。Sergey Rodionovによるこの研究は、これら3つの技術を統合した以前のエージェントの性能がどのコンポーネントによるものかを明らかにすることを目的としている。
研究者らは、テキストベースライン、再生検証なしの柔軟なインターフェースを持つ実行可能世界モデル、同じ実行可能モデルに計画的な単純化を加えたもの、そして単純化を保持し記録された観測の正確な再生を要求する固定インターフェースの検証処理という、4つのネストされたCodexベースのエージェントを設計した。主要実験では、gpt-5.4とgpt-5.5を用いて、高および超高推論努力で公開ARC-AGI-3ゲームにおける全4エージェントを評価。探索的な追試では、gpt-5.6-solを用いて超高と最大推論努力でテキストおよび検証バリアントを評価した。
最も頑健な結果は、全てのエージェントバリアントがより強力なモデルとより高い推論努力によって性能を向上させることである。各モデル・努力設定内では、バリアント間の差は予想よりも小さく、個々のコンポーネントの効果は設定によって異なる。持続的な実行可能な成果物を要求することは普遍的に有益ではなく、テキストベースラインは両方のgpt-5.5設定において柔軟インターフェースの実行可能バリアントを上回った。単純化は4つのモデル・努力設定のうち3つで性能を向上させ、最も弱い設定のみが例外であった。完全な検証処理は全4設定で1位となったが、かなり多くのリソースを消費する。
gpt-5.6-solを用いた追試では、検証バリアントは両方の推論努力で公開ゲームを完全に解決し、約99%のRHAEを達成、人間ベースラインの総行動数の半分未満を使用した。このモデルはこれらのゲームより後にリリースされており、未見データでの性能はテストされていないため、この結果は公開セットの飽和としてのみ解釈されるべきである。この研究は、モデルの強度と推論努力の重要性を強調するとともに、異なるコンポーネントが条件によって異なる効果を持つことを示し、将来のエージェント設計に重要な示唆を与えている。