AI News HubLIVE
サイト内リライト2 分で読了

ProcAgent:エッジ上での人間参加型手順タスクガイダンスのためのエージェントフレームワーク

ProcAgentは、単一のNVIDIA Jetson AGX Orin上で動作する完全オンデバイス・ビジョンベースの手順アシスタントで、リアルタイム適応型ガイダンスを提供します。提案・検証アーキテクチャを採用し、低遅延連続認識、シンボリックタスクグラフ、オンデマンド視覚言語検証、LLMベースの対話エージェントを組み合わせています。テキストクエリは約2秒、視覚クエリは約8秒で処理され、ユーザースタディで肯定的な評価を得ました。

ソースarXiv AI著者: Azizul Zahid, Subrata Biswas, Bashima Islam, Sai Swaminathan

家具の組み立てや家庭の修理などの手順的タスクは、ユーザーに高い認知負荷を課します。指示を解釈し、作業の進捗を追跡し、空間状態を推論し、物理的な行動中にエラーから回復する必要があるためです。これまでのマルチモーダルアシスタントは手順ガイダンスに有望性を示してきましたが、多くはクラウド推論と常時オンの固定認識に依存しており、プライバシーに敏感で低遅延が求められる家庭環境には不適切でした。

これらの制限を克服するため、研究者らはProcAgentを提案しました。これは、単一のNVIDIA Jetson AGX Orin上で動作する完全オンデバイス・ビジョンベースの手順アシスタントで、リアルタイム適応型ガイダンスを実現します。ProcAgentは「提案・検証」アーキテクチャを採用しています。システムは継続的にユーザーの進捗を提案しますが、あいまいさや逸脱の可能性がある場合にのみ高コストな視覚推論を呼び出します。この設計により、低遅延連続認識、シンボリックタスクグラフ、オンデマンド視覚言語検証、LLMベースの対話エージェントが統合されています。

ProcAgentは2つの対話モードをサポートします:リアクティブな質問応答とプロアクティブな介入です。システムがユーザーのエラーや支援の必要性を検出した場合、積極的に提案を行いますが、最終的な実行にはユーザーの確認が必要です(人間参加型)。評価は、認識精度、推論、タスクレベル性能、ユーザー体験の4つの次元で行われました。

完全オンデバイスで動作しながらも、ProcAgentは応答性を維持しています:テキストのみのクエリは約2秒、視覚的クエリは約8秒で処理されます。10名の参加者が組み立てタスクを完了したユーザースタディでは、ProcAgentは理解容易性、実行可能性、プライバシー快適性において肯定的な評価を得ました。これらの結果は、適応型手順支援がユーザビリティを犠牲にすることなくエッジハードウェア上で完全に実現可能であることを示しています。研究者らは、複雑な視覚言語推論をエッジデバイスに完全にデプロイする可能性を示し、プライバシーに敏感な家庭環境への実用的なソリューションを提供すると強調しています。本論文はAzizul Zahidら4名の著者により、2026年6月9日にarXivに提出されました。