跳到主要内容
AI News HubLIVE
站内改写3 分钟阅读

语言内推理:数据混合如何为多语言模型搭桥 | Cohere

文章摘要

Cohere 的研究显示,混合英语推理数据、多语言推理数据和多语言非推理数据,可让模型在用户语言中推理。Tiny Aya L2-Thinker(3.35B)在 60 种语言中超过 93% 的情况下用提示语言思考,准确率损失很小,并在低资源语言上保持表现。研究还发布了模型权重与多语言推理数据。

语言内推理:数据混合如何为多语言模型搭桥 | Cohere
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

近年来,让语言模型在作答前先“思考”已成为提升数学和编程等任务表现的重要方法。模型会生成一段逐步推理轨迹,但多数推理模型默认用英语思考,即使问题用西班牙语、阿拉伯语或斯瓦希里语提出。最终答案可能回到用户语言,推理步骤却仍留在英语中,非英语用户难以核对步骤、定位错误或干预模型。Cohere 在最新博客中提出,多语言 AI 不应只做到“用用户语言回答”,还要迈向“用用户语言推理”,即 L2 reasoning 或 in-language reasoning。

他们指出,语言内推理不仅让用户能够检查和参与推理过程,也可能帮助模型更好地利用文化背景和语言细微差别,因为这些知识通常在源语言中表达最自然。例如,询问印地语中哪个事件象征好运时,Tiny Aya L2-Thinker 会用印地语思考印度迷信并给出正确答案,而英语推理可能直接给出带西方偏见的答案,未充分权衡选项。

文章回顾,此前让模型用用户语言推理的尝试有三方面不足:一是常以准确率下降为代价,避免下降的方法又依赖复杂昂贵的训练;二是评测多集中在数学和科学,而数学恰好是语言影响最小的任务,难以衡量文化知识、指令遵循和开放式写作;三是覆盖语言很少,通常只涉及 AI 研究已关注的高资源语言。Cohere 称其新模型同时应对这三点。

方法核心是训练数据混合,由三个“支柱”组成。第一是英语推理数据(ER),约 170 万条由更大模型 gpt-oss-120b 生成的逐步解答,主要教模型如何解题,对数学尤其重要。但只用这部分数据,模型几乎总用英语推理,即使被明确要求用用户语言,L2 推理率也只有 12.8%。第二是多语言推理数据(MR),团队把数学、科学和通用主题的英语推理样例自动翻译成 44 种语言。由于长推理轨迹翻译成本高,每种语言只有约 5000 条,远少于英语数据;但加入后,L2 推理率从 12.8% 提升到 86.1%,准确率也改善。第三是多语言非推理数据(NR),即目标语言的问题和答案,但不含推理轨迹。这类数据因此前多语言指令模型的使用而更易获得,可帮助模型把在用户语言中推理的能力迁移到新语言,包括未见过推理样例的语言。

基于 Tiny Aya 基础模型和 32K 上下文,团队构建了 Tiny Aya L2-Thinker(3.35B)。该模型在 60 种语言中超过 93% 的情况下用提示语言推理,准确率损失最小,在低资源语言上表现稳定,并且比同类模型使用更少推理 token。团队发布模型权重和多语言推理数据。训练覆盖 45 种语言,并有证据显示该能力可迁移到未提供推理样例的语言。

评测覆盖 60 种语言的六个基准,包括数学(MGSM、PolyMath)、文化与常识推理(Macaron-MCQ、GlobalPIQA)、指令遵循(Marco-Bench-MIF)和开放式写作(MIST-OEG)。他们重点关注三件事:是否在不牺牲质量的情况下实现 L2 推理;低资源语言表现是否保持;推理本身质量如何。对比对象是同一基础模型和相似数据训练、但用英语推理的 Tiny Aya En-Thinker。除准确率外,他们用语言识别模型测量 L2 推理率,即响应中实际用用户语言推理的比例。

结果显示,在六个基准中的五个上,准确率最多下降两到三个百分点;在开放式写作 MIST-OEG 上还略有提升。英语表现也保持,模型在英语提示下仍用英语推理,并在多数基准上匹配英语推理模型。与此同时,用用户语言书写的推理轨迹比例从接近零升至 93% 以上。例外是竞赛级数学基准 PolyMath,准确率下降更明显。Cohere 认为原因是模型未经过强化学习阶段,而高难数学最受益于 RL,RL 也能平滑翻译训练轨迹带来的伪影;这是未来可针对数学推进的方向。他们还发现,推理时强制语言并不能弥补差距:要求 Qwen3.5-4B 用用户语言思考几乎没有改变行为;通过预填充推理轨迹开头来更强强制虽有效,却损害准确率,且大多数用户无法操作。可靠的语言内推理必须来自训练。

在低资源语言方面,团队将评测语言按网络文本量分为四档,第一档资源最高(如英语、德语、法语),第四档最低(如斯瓦希里语、祖鲁语、威尔士语)。与面向 L2 推理的更大模型 M-Thinker-7B 和 Magistral-Small-24B 相比,Tiny Aya L2-Thinker 是唯一在资源下降时三项指标都保持强劲的模型:L2 推理率在第一、二档接近上限 99%,最低两档也仅降至 94.3% 和 94.5%。Magistral 的 L2 推理率从 72% 崩至 5%;M-Thinker 在每个维度退化,推理轨迹长度约翻倍;语言强制的 Qwen 虽保持较高 L2 推理率,但牺牲准确率和效率。Tiny Aya L2-Thinker 平均推理 token 低于 5000,得益于面向多语言优化的分词器。

最后,团队检查推理失败模式。他们用重复分数衡量短文本序列在推理轨迹中重复的频率,并与推理长度比较。两者往往同向上升:模型推理越长,重复率越高。许多长轨迹并非在探索替代方案,而是在同几步上循环,直到耗尽 32,000 token 预算后停止,甚至没有给出答案,即所谓“doomlooping”。Qwen3.5-4B 是最明显例子:它经常花 10,000 到 25,000 token 推理,但未必带来性能提升;预填充目标语言推理也无法挽救,语言强制的 Qwen 仍处于高 token、高重复角落。总体而言,Cohere 认为其数据混合策略把语言内推理从依赖逐语言构建,转变为可通过数据设计实现的能力,即使多语言推理数据稀缺也可接近。

展开要点与分析

文章情报

投资人进阶

要点

  • 多语言 AI 不仅要用用户语言回答,还应用用户语言推理;否则推理轨迹对非英语用户不可读。
  • 三支柱数据混合:英语推理数据提供解题能力,少量多语言推理数据触发目标语言推理,多语言非推理数据帮助迁移到新语言。
  • Tiny Aya L2-Thinker 在 60 种语言中 L2 推理率超过 93%,多数基准准确率仅小幅下降,但竞赛级数学 PolyMath 例外。
  • 推理时强制语言无法可靠解决问题;可靠的语言内推理需要训练数据设计。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。