AI News HubLIVE
站内改写2 分钟阅读

基于强化学习和效率感知奖励的中文文本修正链式推理方法

提出CSRP三阶段框架,通过持续预训练、链式推理监督微调和基于效率感知奖励的组相对策略优化,有效缓解中文语法纠错中的过度纠正问题。在NACGEC基准上取得SOTA性能,F0.5达50.99,精确率57.17;在CSCD拼写纠正任务中F1达59.61,超过GPT-4 5.20个百分点。

来源arXiv Computational Linguistics作者: Wei Tian, Yuhao Zhou, Man Lan

中文语法纠错(CGEC)是大语言模型(LLM)的重要应用方向,但面临两大核心挑战。首先,通用预训练模型缺少针对中文细微语法差异的语言学先验知识,导致对病句的敏感度不足。其次,传统的监督微调(SFT)使用最大似然估计(MLE)进行训练,虽然能提高修正的召回率,但无法优化以精确率为导向的指标,从而引发系统性的过度纠正问题——模型倾向于对正确的句子也进行不必要的修改。

为了应对这些挑战,华东师范大学的研究团队提出了CSRP框架,通过三个阶段的渐进式训练构建出高质量的中文语法纠错能力。第一阶段是持续预训练(CPT),研究团队在包含590万条平衡样本的专用数据集上进行持续预训练,使模型内化中文语法领域的专业知识。第二阶段是链式推理监督微调(CoT SFT),不同于传统方法直接输出修正结果,CSRP要求模型显式生成错误的推理过程,包括错误类型识别、错误位置定位和修正策略,从而大幅提升诊断的透明度和可解释性。第三阶段是结合效率感知奖励的组相对策略优化(GRPO),研究者设计了一种新颖的效率感知奖励函数,对不必要的编辑行为给予负面奖励,从而有效抑制过度纠正倾向。

在权威基准测试中,CSRP取得了令人瞩目的成绩。在NACGEC(Native Chinese Grammatical Error Correction)基准上,CSRP达到了50.99的F0.5分数和57.17的精确率,显著优于此前的最佳结果,有效缓解了MLE训练模型固有的过度纠正偏差。在CSCD(Chinese Spelling Correction Dataset)拼写纠正任务中,CSRP的F1分数达到59.61,超越了包括GPT-4在内的现有顶尖模型,领先幅度达5.20个百分点。详细的消融实验表明,强化学习对齐阶段相比SFT基线带来了8%的相对提升,并且这一提升与大规模CPT的贡献相互正交,验证了显式优化编辑效率对于高质量语法纠错至关重要。

目前,CSRP的源代码已在GitHub上开源,供研究社区使用和进一步改进。该研究工作已被计算语言学顶会ACL 2026主会接收,预计在大会上展示。CSRP的成功不仅为中文语法纠错提供了新的技术途径,也为其他语言的语言校正任务提供了可借鉴的思路。