面向法律探究型對話智能體的雙重層次對話策略學習
本文提出探究型對話智能體(ICA)概念,並針對美國最高法院口頭辯論場景開發了基於雙重層次強化學習的框架。該框架通過兩個協作的強化學習代理分別管理戰略對話和細粒度語句生成,模擬法官提問模式以主動獲取關鍵法律信息。在最高法院數據集上的評估表明,該方法在多項指標上優於基線模型,為高風險領域專業應用邁出第一步。
近日,一項發表於ACL 2026的研究提出了“探究型對話智能體”(Inquisitive Conversational Agents, ICA)的新概念,並針對美國最高法院口頭辯論這一特殊場景開發了相應的智能系統。傳統對話系統大多以用户驅動為主,旨在滿足用户請求,但在許多關鍵現實場景中,對話智能體需要主動提取信息以實現自身目標。例如在法律諮詢、醫療診斷或金融談判中,智能體必須主動詢問關鍵細節,而不是等待用户提供所有信息。為此,研究團隊提出了雙重層次強化學習框架,其中兩個強化學習代理相互協作:一個負責宏觀對話策略管理,決定何時改變話題、深入追問或總結;另一個負責微觀語句生成,控制具體問題的措辭和語氣。這種層次化設計使得智能體能夠像法官一樣,在口頭辯論中通過策略性提問逐步揭示案件的關鍵事實和法律依據。
該框架的核心優勢在於其靈活性。宏觀代理學習整體對話路徑,例如從開場問題逐漸深入到爭議焦點;微觀代理則根據當前對話狀態生成自然且具有針對性的問題。兩個代理通過共享的獎勵信號進行聯合優化,獎勵函數設計為鼓勵智能體在有限的對話輪次內獲取最相關的法律信息。研究團隊使用美國最高法院的歷史口頭辯論記錄進行訓練和評估,這些記錄包含了法官與律師之間的真實問答模式。實驗結果表明,該方法在多個人工評估和自動指標上均優於多種基線模型,包括基於規則的系統和傳統的強化學習變體。特別地,該智能體能夠有效識別信息缺口,並在適當的時間點提出探究性問題,從而顯著提高了信息獲取的完整性和效率。
儘管當前工作專注於法律場景,但研究人員指出其框架具有通用性,未來可擴展至醫療、金融、客户服務等其他需要主動信息獲取的領域。該論文已被ACL 2026接收為Findings論文,相關代碼和數據也已公開,供學界進一步研究和改進。這項研究標誌着對話系統從被動響應向主動探究的重要轉變,為高風險領域中的專業對話應用奠定了堅實基礎。