AI News HubLIVE
サイト内リライト2 分で読了

CAX-Agent: 信頼性の高いAPDL自動化のための軽量エージェントハーネス

CAX-Agentは、MAPDL有限要素シミュレーションの自動化に特化した軽量エージェントハーネスであり、3層アーキテクチャとリカバリラダーを採用して信頼性を向上させる。3つのリカバリ戦略の実験評価では、モデル駆動型リカバリ(model_only)が完了率、タスクスコア、無介入率でルールベースおよびリカバリなしの戦略を大幅に上回った。

ソースarXiv AI著者: Chenying Lin, Yichen Hai, Yi He, Ran Wang, Haiyan Qiang, Liang Yu

大規模言語モデル(LLM)をMAPDL有限要素シミュレーションに適用する際、構造化された実行制御、ツールカプセル化、障害回復がないと、出力の一貫性が失われ、タスク失敗が頻発するという信頼性上の課題がある。エージェントハーネスパラダイムは、ドメイン固有のオーケストレーションミドルウェアを挿入し、ツールライフサイクル、ワークフロー状態、回復エスカレーションを管理することでこの問題に対処する。

本論文では、MAPDL自動化に特化した軽量エージェントハーネスであるCAX-Agentのアーキテクチャを紹介する。CAX-Agentは実行をLLMサービス層、エージェントハーネス層、ソルバーバックエンド層の3層に編成し、確定的なルールパッチからモデル駆動型再生成、コンテキスト強化、人間の介入へとエスカレートするリカバリラダーを備える。

研究チームは、50の標準構造ベンチマークにおいて3つのリカバリ戦略(リカバリなし(no_recovery)、ルールのみ(rule_only)、モデルのみ(model_only))を評価し、各戦略を3回繰り返して合計450ケースの実行を行った。2人の独立した人間評価者がブラインド条件下でタスク完了度を採点し、評価者間一致度は高かった(二次重み付けCohenのkappa = 0.84、96%のスコアペアが1点差以内)。

結果、モデルのみ戦略(model_only)が完了率0.9267、タスクスコア3.59/4、総合スコア9.16/10、無介入率0.84と最も優れており、ルールのみ戦略(rule_only)の完了率0.7733、タスクスコア3.17/4、総合スコア7.03/10、無介入率0.00、およびリカバリなし戦略(no_recovery)の完了率0.6933、タスクスコア2.74/4、総合スコア5.60/10、無介入率0.00を大きく上回った(Cliff's delta = 0.81-0.87、大きな効果量)。

なお、ベンチマークではリカバリポリシーの効果を分離するために意図的に単純な形状を用いている。本研究結果の適用範囲と、より広範な検証の方向性について議論する。