AI News HubLIVE
站內改寫1 分鐘閱讀

狀態中心決策過程

研究者提出狀態中心決策過程(SDP),這是一種執行時框架,允許智慧體透過承諾自然語言謂詞,從原始文本環境中構建類似MDP的結構。SDP在五個基準測試上取得了最佳的無訓練結果,並提供了認證軌跡以支援高階分析。

來源arXiv AI作者: Sungheon Jeong, Ryozo Masukawa, Sanggeon Yun, Mahdi Imani, Mohsen Imani

語言環境如網頁瀏覽器、程式碼終端和互動式模擬通常只輸出原始文本,而不提供馬爾可夫決策過程(MDP)分析所需的執行時結構。這些環境沒有明確的狀態空間、觀測到狀態的對映、認證的轉移規則或終止準則。這一缺失嚴重限制了智慧體在複雜語言任務中的決策能力。來自多所機構的研究團隊提出了一種名為“狀態中心決策過程”(State-Centric Decision Process, SDP)的新型框架,旨在填補這一空白。

SDP的核心創新在於讓智慧體在行動過程中逐步構建缺失的MDP元件。具體而言,智慧體在每一步都會承諾一個描述世界預期狀態的自然語言謂詞,然後執行一個動作使該謂詞成立,並透過觀測驗證該謂詞是否與實際情況一致。透過驗證的謂詞成為認證狀態,整個軌跡最終包含了任務誘導的狀態空間、觀測到狀態的對映、認證轉移和終止準則。這種方法使得智慧體能夠在原本缺乏結構的語言環境中進行有效的決策。

研究者在五個涵蓋不同領域的基準上對SDP進行了全面評估,包括規劃、科學探索、網路推理和多跳問答。結果表明,SDP在所有基準上均取得了最佳的無訓練結果,並且隨著任務時序增長,其優勢更加明顯。例如,在處理需要多步推理的複雜任務時,SDP能夠保持穩定的效能提升。此外,認證軌跡還支援多種傳統反應式智慧體無法實現的分析功能,如逐謂詞信用分配、故障定位、部分進展測量以及模組化運算子替換。這些能力使得開發者能夠更深入地理解智慧體的決策過程,並針對性地進行最佳化。

該工作為語言環境中的智慧決策提供了新的思路,展示了結構化表徵在複雜任務中的重要性。未來,SDP有望被整合到各類語言互動系統中,提升自主智慧體在現實場景中的可靠性。