AI News HubLIVE
站內改寫1 分鐘閱讀

狀態中心決策過程

研究者提出狀態中心決策過程(SDP),這是一種運行時框架,允許智能體通過承諾自然語言謂詞,從原始文本環境中構建類似MDP的結構。SDP在五個基準測試上取得了最佳的無訓練結果,並提供了認證軌跡以支持高級分析。

來源arXiv AI作者: Sungheon Jeong, Ryozo Masukawa, Sanggeon Yun, Mahdi Imani, Mohsen Imani

語言環境如網頁瀏覽器、代碼終端和交互式模擬通常只輸出原始文本,而不提供馬爾可夫決策過程(MDP)分析所需的運行時結構。這些環境沒有明確的狀態空間、觀測到狀態的映射、認證的轉移規則或終止準則。這一缺失嚴重限制了智能體在複雜語言任務中的決策能力。來自多所機構的研究團隊提出了一種名為“狀態中心決策過程”(State-Centric Decision Process, SDP)的新型框架,旨在填補這一空白。

SDP的核心創新在於讓智能體在行動過程中逐步構建缺失的MDP組件。具體而言,智能體在每一步都會承諾一個描述世界預期狀態的自然語言謂詞,然後執行一個動作使該謂詞成立,並通過觀測驗證該謂詞是否與實際情況一致。通過驗證的謂詞成為認證狀態,整個軌跡最終包含了任務誘導的狀態空間、觀測到狀態的映射、認證轉移和終止準則。這種方法使得智能體能夠在原本缺乏結構的語言環境中進行有效的決策。

研究者在五個涵蓋不同領域的基準上對SDP進行了全面評估,包括規劃、科學探索、網絡推理和多跳問答。結果表明,SDP在所有基準上均取得了最佳的無訓練結果,並且隨着任務時序增長,其優勢更加明顯。例如,在處理需要多步推理的複雜任務時,SDP能夠保持穩定的性能提升。此外,認證軌跡還支持多種傳統反應式智能體無法實現的分析功能,如逐謂詞信用分配、故障定位、部分進展測量以及模塊化操作符替換。這些能力使得開發者能夠更深入地理解智能體的決策過程,並針對性地進行優化。

該工作為語言環境中的智能決策提供了新的思路,展示了結構化表徵在複雜任務中的重要性。未來,SDP有望被集成到各類語言交互系統中,提升自主智能體在現實場景中的可靠性。