近年來,讓語言模型在作答前先“思考”已成為提升數學和程式設計等任務表現的重要方法。模型會生成一段逐步推理軌跡,但多數推理模型預設用英語思考,即使問題用西班牙語、阿拉伯語或斯瓦希里語提出。最終答案可能回到使用者語言,推理步驟卻仍留在英語中,非英語使用者難以核對步驟、定位錯誤或干預模型。Cohere 在最新部落格中提出,多語言 AI 不應只做到“用使用者語言回答”,還要邁向“用使用者語言推理”,即 L2 reasoning 或 in-language reasoning。
他們指出,語言內推理不僅讓使用者能夠檢查和參與推理過程,也可能幫助模型更好地利用文化背景和語言細微差別,因為這些知識通常在源語言中表達最自然。例如,詢問印地語中哪個事件象徵好運時,Tiny Aya L2-Thinker 會用印地語思考印度迷信並給出正確答案,而英語推理可能直接給出帶西方偏見的答案,未充分權衡選項。
文章回顧,此前讓模型用使用者語言推理的嘗試有三方面不足:一是常以準確率下降為代價,避免下降的方法又依賴複雜昂貴的訓練;二是評測多集中在數學和科學,而數學恰好是語言影響最小的任務,難以衡量文化知識、指令遵循和開放式寫作;三是覆蓋語言很少,通常只涉及 AI 研究已關注的高資源語言。Cohere 稱其新模型同時應對這三點。
方法核心是訓練資料混合,由三個“支柱”組成。第一是英語推理資料(ER),約 170 萬條由更大模型 gpt-oss-120b 生成的逐步解答,主要教模型如何解題,對數學尤其重要。但只用這部分資料,模型幾乎總用英語推理,即使被明確要求用使用者語言,L2 推理率也只有 12.8%。第二是多語言推理資料(MR),團隊把數學、科學和通用主題的英語推理樣例自動翻譯成 44 種語言。由於長推理軌跡翻譯成本高,每種語言只有約 5000 條,遠少於英語資料;但加入後,L2 推理率從 12.8% 提升到 86.1%,準確率也改善。第三是多語言非推理資料(NR),即目標語言的問題和答案,但不含推理軌跡。這類資料因此前多語言指令模型的使用而更易獲得,可幫助模型把在使用者語言中推理的能力遷移到新語言,包括未見過推理樣例的語言。
基於 Tiny Aya 基礎模型和 32K 上下文,團隊構建了 Tiny Aya L2-Thinker(3.35B)。該模型在 60 種語言中超過 93% 的情況下用提示語言推理,準確率損失最小,在低資源語言上表現穩定,並且比同類模型使用更少推理 token。團隊釋出模型權重和多語言推理資料。訓練覆蓋 45 種語言,並有證據顯示該能力可遷移到未提供推理樣例的語言。
評測覆蓋 60 種語言的六個基準,包括數學(MGSM、PolyMath)、文化與常識推理(Macaron-MCQ、GlobalPIQA)、指令遵循(Marco-Bench-MIF)和開放式寫作(MIST-OEG)。他們重點關注三件事:是否在不犧牲質量的情況下實現 L2 推理;低資源語言表現是否保持;推理本身質量如何。對比物件是同一基礎模型和相似資料訓練、但用英語推理的 Tiny Aya En-Thinker。除準確率外,他們用語言識別模型測量 L2 推理率,即響應中實際用使用者語言推理的比例。
結果顯示,在六個基準中的五個上,準確率最多下降兩到三個百分點;在開放式寫作 MIST-OEG 上還略有提升。英語表現也保持,模型在英語提示下仍用英語推理,並在多數基準上匹配英語推理模型。與此同時,用使用者語言書寫的推理軌跡比例從接近零升至 93% 以上。例外是競賽級數學基準 PolyMath,準確率下降更明顯。Cohere 認為原因是模型未經過強化學習階段,而高難數學最受益於 RL,RL 也能平滑翻譯訓練軌跡帶來的偽影;這是未來可針對數學推進的方向。他們還發現,推理時強制語言並不能彌補差距:要求 Qwen3.5-4B 用使用者語言思考幾乎沒有改變行為;透過預填充推理軌跡開頭來更強強制雖有效,卻損害準確率,且大多數使用者無法操作。可靠的語言內推理必須來自訓練。
在低資源語言方面,團隊將評測語言按網路文本量分為四檔,第一檔資源最高(如英語、德語、法語),第四檔最低(如斯瓦希里語、祖魯語、威爾士語)。與面向 L2 推理的更大模型 M-Thinker-7B 和 Magistral-Small-24B 相比,Tiny Aya L2-Thinker 是唯一在資源下降時三項指標都保持強勁的模型:L2 推理率在第一、二檔接近上限 99%,最低兩檔也僅降至 94.3% 和 94.5%。Magistral 的 L2 推理率從 72% 崩至 5%;M-Thinker 在每個維度退化,推理軌跡長度約翻倍;語言強制的 Qwen 雖保持較高 L2 推理率,但犧牲準確率和效率。Tiny Aya L2-Thinker 平均推理 token 低於 5000,得益於面向多語言最佳化的分詞器。
最後,團隊檢查推理失敗模式。他們用重複分數衡量短文本序列在推理軌跡中重複的頻率,並與推理長度比較。兩者往往同向上升:模型推理越長,重複率越高。許多長軌跡並非在探索替代方案,而是在同幾步上迴圈,直到耗盡 32,000 token 預算後停止,甚至沒有給出答案,即所謂“doomlooping”。Qwen3.5-4B 是最明顯例子:它經常花 10,000 到 25,000 token 推理,但未必帶來效能提升;預填充目標語言推理也無法挽救,語言強制的 Qwen 仍處於高 token、高重複角落。總體而言,Cohere 認為其資料混合策略把語言內推理從依賴逐語言構建,轉變為可透過資料設計實現的能力,即使多語言推理資料稀缺也可接近。