跳到主要內容
AI News HubLIVE
站內改寫3 分鐘閱讀

語言內推理:數據混合如何為多語言模型搭橋 | Cohere

文章摘要

Cohere 的研究顯示,混合英語推理數據、多語言推理數據和多語言非推理數據,可讓模型在用户語言中推理。Tiny Aya L2-Thinker(3.35B)在 60 種語言中超過 93% 的情況下用提示語言思考,準確率損失很小,並在低資源語言上保持表現。研究還發布了模型權重與多語言推理數據。

語言內推理:數據混合如何為多語言模型搭橋 | Cohere
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

近年來,讓語言模型在作答前先“思考”已成為提升數學和編程等任務表現的重要方法。模型會生成一段逐步推理軌跡,但多數推理模型默認用英語思考,即使問題用西班牙語、阿拉伯語或斯瓦希里語提出。最終答案可能回到用户語言,推理步驟卻仍留在英語中,非英語用户難以核對步驟、定位錯誤或干預模型。Cohere 在最新博客中提出,多語言 AI 不應只做到“用用户語言回答”,還要邁向“用用户語言推理”,即 L2 reasoning 或 in-language reasoning。

他們指出,語言內推理不僅讓用户能夠檢查和參與推理過程,也可能幫助模型更好地利用文化背景和語言細微差別,因為這些知識通常在源語言中表達最自然。例如,詢問印地語中哪個事件象徵好運時,Tiny Aya L2-Thinker 會用印地語思考印度迷信並給出正確答案,而英語推理可能直接給出帶西方偏見的答案,未充分權衡選項。

文章回顧,此前讓模型用用户語言推理的嘗試有三方面不足:一是常以準確率下降為代價,避免下降的方法又依賴複雜昂貴的訓練;二是評測多集中在數學和科學,而數學恰好是語言影響最小的任務,難以衡量文化知識、指令遵循和開放式寫作;三是覆蓋語言很少,通常只涉及 AI 研究已關注的高資源語言。Cohere 稱其新模型同時應對這三點。

方法核心是訓練數據混合,由三個“支柱”組成。第一是英語推理數據(ER),約 170 萬條由更大模型 gpt-oss-120b 生成的逐步解答,主要教模型如何解題,對數學尤其重要。但只用這部分數據,模型幾乎總用英語推理,即使被明確要求用用户語言,L2 推理率也只有 12.8%。第二是多語言推理數據(MR),團隊把數學、科學和通用主題的英語推理樣例自動翻譯成 44 種語言。由於長推理軌跡翻譯成本高,每種語言只有約 5000 條,遠少於英語數據;但加入後,L2 推理率從 12.8% 提升到 86.1%,準確率也改善。第三是多語言非推理數據(NR),即目標語言的問題和答案,但不含推理軌跡。這類數據因此前多語言指令模型的使用而更易獲得,可幫助模型把在用户語言中推理的能力遷移到新語言,包括未見過推理樣例的語言。

基於 Tiny Aya 基礎模型和 32K 上下文,團隊構建了 Tiny Aya L2-Thinker(3.35B)。該模型在 60 種語言中超過 93% 的情況下用提示語言推理,準確率損失最小,在低資源語言上表現穩定,並且比同類模型使用更少推理 token。團隊發佈模型權重和多語言推理數據。訓練覆蓋 45 種語言,並有證據顯示該能力可遷移到未提供推理樣例的語言。

評測覆蓋 60 種語言的六個基準,包括數學(MGSM、PolyMath)、文化與常識推理(Macaron-MCQ、GlobalPIQA)、指令遵循(Marco-Bench-MIF)和開放式寫作(MIST-OEG)。他們重點關注三件事:是否在不犧牲質量的情況下實現 L2 推理;低資源語言表現是否保持;推理本身質量如何。對比對象是同一基礎模型和相似數據訓練、但用英語推理的 Tiny Aya En-Thinker。除準確率外,他們用語言識別模型測量 L2 推理率,即響應中實際用用户語言推理的比例。

結果顯示,在六個基準中的五個上,準確率最多下降兩到三個百分點;在開放式寫作 MIST-OEG 上還略有提升。英語表現也保持,模型在英語提示下仍用英語推理,並在多數基準上匹配英語推理模型。與此同時,用用户語言書寫的推理軌跡比例從接近零升至 93% 以上。例外是競賽級數學基準 PolyMath,準確率下降更明顯。Cohere 認為原因是模型未經過強化學習階段,而高難數學最受益於 RL,RL 也能平滑翻譯訓練軌跡帶來的偽影;這是未來可針對數學推進的方向。他們還發現,推理時強制語言並不能彌補差距:要求 Qwen3.5-4B 用用户語言思考幾乎沒有改變行為;通過預填充推理軌跡開頭來更強強制雖有效,卻損害準確率,且大多數用户無法操作。可靠的語言內推理必須來自訓練。

在低資源語言方面,團隊將評測語言按網絡文本量分為四檔,第一檔資源最高(如英語、德語、法語),第四檔最低(如斯瓦希里語、祖魯語、威爾士語)。與面向 L2 推理的更大模型 M-Thinker-7B 和 Magistral-Small-24B 相比,Tiny Aya L2-Thinker 是唯一在資源下降時三項指標都保持強勁的模型:L2 推理率在第一、二檔接近上限 99%,最低兩檔也僅降至 94.3% 和 94.5%。Magistral 的 L2 推理率從 72% 崩至 5%;M-Thinker 在每個維度退化,推理軌跡長度約翻倍;語言強制的 Qwen 雖保持較高 L2 推理率,但犧牲準確率和效率。Tiny Aya L2-Thinker 平均推理 token 低於 5000,得益於面向多語言優化的分詞器。

最後,團隊檢查推理失敗模式。他們用重複分數衡量短文本序列在推理軌跡中重複的頻率,並與推理長度比較。兩者往往同向上升:模型推理越長,重複率越高。許多長軌跡並非在探索替代方案,而是在同幾步上循環,直到耗盡 32,000 token 預算後停止,甚至沒有給出答案,即所謂“doomlooping”。Qwen3.5-4B 是最明顯例子:它經常花 10,000 到 25,000 token 推理,但未必帶來性能提升;預填充目標語言推理也無法挽救,語言強制的 Qwen 仍處於高 token、高重複角落。總體而言,Cohere 認為其數據混合策略把語言內推理從依賴逐語言構建,轉變為可通過數據設計實現的能力,即使多語言推理數據稀缺也可接近。

展開要點與分析

文章情報

投資人進階

要點

  • 多語言 AI 不僅要用用户語言回答,還應用用户語言推理;否則推理軌跡對非英語用户不可讀。
  • 三支柱數據混合:英語推理數據提供解題能力,少量多語言推理數據觸發目標語言推理,多語言非推理數據幫助遷移到新語言。
  • Tiny Aya L2-Thinker 在 60 種語言中 L2 推理率超過 93%,多數基準準確率僅小幅下降,但競賽級數學 PolyMath 例外。
  • 推理時強制語言無法可靠解決問題;可靠的語言內推理需要訓練數據設計。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。