AI News HubLIVE
站內改寫1 分鐘閱讀

ProcAgent:一種在邊緣裝置上具有人機互動的程式任務指導代理框架

ProcAgent是一個完全在裝置上執行的、基於視覺的程式任務助手,在單個NVIDIA Jetson AGX Orin上實現即時自適應指導。它採用提出-驗證架構,結合低延遲連續感知、符號任務圖、按需視覺語言驗證和基於LLM的互動代理。評估顯示,純文本查詢約2秒,視覺查詢約8秒,使用者研究獲得積極評價。

來源arXiv AI作者: Azizul Zahid, Subrata Biswas, Bashima Islam, Sai Swaminathan

傢俱組裝、家居維修等程式性任務對使用者提出了很高的認知要求,因為他們需要同時理解指令、跟蹤進度、推理空間狀態並從錯誤中恢復。過去的多模態助手雖然展現出潛力,但大多依賴雲端推理和始終開啟的固定感知,不適合注重隱私和低延遲的家庭環境。

為了克服這些限制,研究人員提出了ProcAgent——一個完全在裝置上執行的、基於視覺的代理程式任務助手,僅需單個NVIDIA Jetson AGX Orin即可實現即時自適應指導。ProcAgent採用一種新穎的“提出-驗證”架構:系統持續提出使用者進度,但僅在出現歧義或可能偏差時才呼叫昂貴的視覺推理。這種設計結合了低延遲連續感知、符號任務圖、按需視覺語言驗證以及基於大語言模型(LLM)的互動代理。

ProcAgent支援兩種互動模式:反應式問答和主動干預。當系統檢測到使用者可能出錯或需要幫助時,會主動提出建議,但最終執行需經使用者確認(人機互動)。評估從四個維度進行:感知準確性、推理能力、任務級效能和使用者體驗。

儘管完全在裝置上執行,ProcAgent仍保持了響應性:處理純文本查詢約需2秒,視覺查詢約需8秒。在10名參與者完成的組裝任務使用者研究中,ProcAgent在可理解性、可操作性和隱私舒適度方面均獲得積極評價。這些結果表明,無需犧牲可用性,自適應程式協助完全可以在邊緣硬體上實現。研究人員強調,該工作展示了將複雜視覺語言推理完全部署在邊緣裝置上的可行性,為隱私敏感的家庭場景提供了實用方案。論文由Azizul Zahid等四位作者完成,於2026年6月9日提交至arXiv。