AI News HubLIVE
站內改寫2 分鐘閱讀

基於強化學習和效率感知獎勵的中文文本修正鏈式推理方法

提出CSRP三階段框架,通過持續預訓練、鏈式推理監督微調和基於效率感知獎勵的組相對策略優化,有效緩解中文語法糾錯中的過度糾正問題。在NACGEC基準上取得SOTA性能,F0.5達50.99,精確率57.17;在CSCD拼寫糾正任務中F1達59.61,超過GPT-4 5.20個百分點。

來源arXiv Computational Linguistics作者: Wei Tian, Yuhao Zhou, Man Lan

中文語法糾錯(CGEC)是大語言模型(LLM)的重要應用方向,但面臨兩大核心挑戰。首先,通用預訓練模型缺少針對中文細微語法差異的語言學先驗知識,導致對病句的敏感度不足。其次,傳統的監督微調(SFT)使用最大似然估計(MLE)進行訓練,雖然能提高修正的召回率,但無法優化以精確率為導向的指標,從而引發系統性的過度糾正問題——模型傾向於對正確的句子也進行不必要的修改。

為了應對這些挑戰,華東師範大學的研究團隊提出了CSRP框架,通過三個階段的漸進式訓練構建出高質量的中文語法糾錯能力。第一階段是持續預訓練(CPT),研究團隊在包含590萬條平衡樣本的專用數據集上進行持續預訓練,使模型內化中文語法領域的專業知識。第二階段是鏈式推理監督微調(CoT SFT),不同於傳統方法直接輸出修正結果,CSRP要求模型顯式生成錯誤的推理過程,包括錯誤類型識別、錯誤位置定位和修正策略,從而大幅提升診斷的透明度和可解釋性。第三階段是結合效率感知獎勵的組相對策略優化(GRPO),研究者設計了一種新穎的效率感知獎勵函數,對不必要的編輯行為給予負面獎勵,從而有效抑制過度糾正傾向。

在權威基準測試中,CSRP取得了令人矚目的成績。在NACGEC(Native Chinese Grammatical Error Correction)基準上,CSRP達到了50.99的F0.5分數和57.17的精確率,顯著優於此前的最佳結果,有效緩解了MLE訓練模型固有的過度糾正偏差。在CSCD(Chinese Spelling Correction Dataset)拼寫糾正任務中,CSRP的F1分數達到59.61,超越了包括GPT-4在內的現有頂尖模型,領先幅度達5.20個百分點。詳細的消融實驗表明,強化學習對齊階段相比SFT基線帶來了8%的相對提升,並且這一提升與大規模CPT的貢獻相互正交,驗證了顯式優化編輯效率對於高質量語法糾錯至關重要。

目前,CSRP的源代碼已在GitHub上開源,供研究社區使用和進一步改進。該研究工作已被計算語言學頂會ACL 2026主會接收,預計在大會上展示。CSRP的成功不僅為中文語法糾錯提供了新的技術途徑,也為其他語言的語言校正任務提供了可借鑑的思路。