FormulaSPIN:自对弈微调用于自然语言到电子表格公式生成
提出FORMULASPIN自对弈框架,利用公式可执行性作为隐性监督,通过两玩家游戏和ExecVote机制,无需额外数据即可提升性能,在NL2FORMULA基准上达到74.9%精确匹配和87.1%执行准确率。
电子表格应用被全球数亿人使用,但编写公式仍然是主要障碍。现有方法依赖静态监督数据,但受限于标注数量,性能很快饱和。针对这一问题,研究者提出了FORMULASPIN,一种自对弈微调框架,能够在没有额外数据的情况下实现迭代自我改进,从而突破监督微调的天花板。
原始SPIN方法在此任务上失败,因为它对所有不匹配输出进行统一惩罚,导致执行等价的替代公式在一个例子中被视为负例,而在另一个例子中作为真实值,产生相互矛盾的梯度。FORMULASPIN通过利用公式生成的独特优势解决这一问题:二进制可执行性提供了隐性监督,将语义错误与有效的风格变体区分开来。该框架将训练过程构建为两玩家游戏,主玩家学习偏向真实公式,而执行反馈将输出按不同粒度排序,形成从语义正确性到风格优化的自适应课程。
为进一步提高准确性,研究者加入了ExecVote机制,一种语义级投票机制,自然地处理多种有效公式表示。实验在多个基准上进行,包括NL2FORMULA、WikiSQL和Spider等数据集。在NL2FORMULA上,FORMULASPIN达到了74.9%的精确匹配率和87.1%的执行准确率,与使用额外偏好标注训练的模型相当,同时优于传统监督微调和前沿专有模型,如GPT-4和Claude。论文被ACL 2026主会议接收为Oral,共15页、7张图和14个表格。
这些发现凸显了自对弈方法在数据稀缺任务中的潜力,并为将其扩展到可执行领域之外打开了大门。例如,该方法可应用于代码生成、程序合成等具有可执行反馈的任务。研究者还计划探索将自对弈框架应用于半结构化数据生成和非可执行领域。