近年、言語モデルが答える前に「考える」ことは、数学やコーディングといったタスクの性能を大きく高めてきた。モデルは段階的な推論トレースを生成するが、多くの推論モデルはデフォルトで英語で考える。スペイン語、アラビア語、スワヒリ語で質問しても同じだ。最終的な答えはユーザーの言語で返ってくることもあるが、その裏側の推論ステップは英語のまま残り、英語を話さないユーザーは手順を確認したり、誤りを特定したり、必要に応じて介入したりできない。Cohereは最新のブログで、多言語AIは「ユーザーの言語で答える」だけでなく、「ユーザーの言語で推論する」段階、すなわちL2推論(言語内推論)へ進むべきだと主張する。
言語内推論は、ユーザーが推論過程を読み、検証し、関与できるようにするだけでなく、モデル自身の助けにもなり得る。文化的な文脈や言語的なニュアンスといった知識は、その源言語で最も自然に表現されることが多い。たとえば、ヒンディー語で「幸運を象徴する出来事はどれか」と尋ねると、Tiny Aya L2-Thinkerはヒンディー語でインドの迷信について推論し正答に至るが、英語で考えると、選択肢を十分に比較せず西洋に偏った答えを提示してしまう。
従来の試みには三つの不足があった。第一に、ユーザーの言語で推論させると精度が落ちることが多く、それを避ける方法は複雑で高コストな学習に依存していた。第二に、評価が数学や科学に偏りがちで、数学は言語の影響が最も小さいタスクであるため、文化知識や指示追従、自由記述を測るには不十分だった。第三に、対象となる言語が少数で、すでにAI研究の注目を集める高資源言語に限られていた。Cohereは、新モデルでこの三点に同時に対処したと述べている。
手法の核心は、三つの「柱」から成る学習データの混合だ。第一の柱は英語推論データ(ER)で、より大きなモデルgpt-oss-120bが生成した約170万件の段階的解答であり、主に問題の解き方を教え、数学で特に重要となる。しかしこれだけではモデルはほぼ常に英語で推論し、明示的にユーザーの言語で考えろと指示してもL2推論率は12.8%にとどまる。第二の柱は多言語推論データ(MR)で、数学・科学・一般トピックの英語推論例を44言語へ自動翻訳したものだ。長い推論トレースの翻訳は高コストなため、各言語あたり約5000件と英語データに比べてごくわずかしかない。それでも加えるだけでL2推論率は12.8%から86.1%へ上昇し、精度も改善した。第三の柱は多言語非推論データ(NR)で、対象言語の質問と回答を含むが推論トレースは含まない。従来の多言語指示モデルで使われてきたため入手しやすく、ユーザーの言語で推論する能力を、推論例を見たことのない言語を含む新しい言語へ移転させる助けになる。
チームはTiny Ayaベースモデルと32Kコンテキストを用いてTiny Aya L2-Thinker(3.35B)を構築した。このモデルは60言語で93%以上の場合にプロンプトの言語で推論し、精度の低下は最小限で、低資源言語でも安定し、同種のモデルより少ない推論トークンで済む。学習は45言語をカバーし、推論例を示していない言語にもこの能力が移転する証拠がある。モデルの重みと多言語推論データは公開される。
評価は60言語にまたがる6つのベンチマークで行われた。数学(MGSM、PolyMath)、文化・常識推論(Macaron-MCQ、GlobalPIQA)、指示追従(Marco-Bench-MIF)、自由記述(MIST-OEG)を対象とする。注目点は三つだ。品質を犠牲にせずL2推論を達成できているか。低資源言語で性能が維持されるか。推論そのものの質はどうか。比較相手は、同じベースモデルと類似のデータで学習しながら英語で推論するTiny Aya En-Thinkerである。精度に加え、各推論トレースに言語識別モデルを適用して、実際にユーザーの言語で推論した割合(L2推論率)を測る。
結果として、6つのベンチマークのうち5つで精度低下は最大2〜3ポイントに収まり、自由記述のMIST-OEGではわずかに向上した。英語の性能も維持され、英語プロンプトでは英語で推論し、多くのベンチマークで英語推論モデルに匹敵する。一方で、ユーザーの言語で書かれたトレースの割合はほぼゼロから93%超へ上昇した。例外は競技レベルの数学ベンチマークPolyMathで、精度の低下がより顕著だ。Cohereは、モデルが強化学習の段階を経ていないためだと見ている。高難度の数学はRLの恩恵を最も受け、RLは翻訳した学習トレースに生じたアーティファクトも平滑化する。これは数学に焦点を当てた今後の方向性だという。
推論時に言語を強制しても差は埋まらないことも分かった。Qwen3.5-4Bにユーザーの言語で考えさせるよう求めても行動はほとんど変わらず、推論トレースの冒頭をプリフィルしてより強く強制すると効果はあるものの精度を損ない、大半のユーザーには実行できない。信頼できる言語内推論は学習からしか得られない。
低資源言語については、チームは評価言語をウェブテキスト量によって4段階に分けた。第1段階が最も高資源(英語、ドイツ語、フランス語など)で、第4段階が最低(スワヒリ語、ズールー語、ウェールズ語など)だ。L2推論向けに作られたより大きなモデルM-Thinker-7BやMagistral-Small-24Bと比べ、Tiny Aya L2-Thinkerは資源が減っても三つの軸すべてで強さを保つ唯一のモデルである。L2推論率は第1・第2段階で上限近くの99%、最低の2段階でも94.3%と94.5%までしか下がらない。対照的に、MagistralはL2推論率が72%から5%へ崩壊し、M-Thinkerはあらゆる軸で劣化してトレース長がおよそ2倍になり、言語を強制したQwenはL2推論率をかなり高く保つが精度と効率を犠牲にする。Tiny Aya L2-Thinkerは多言語向けに最適化したトークナイザのおかげで、平均推論トークンも5000未満と経済的だ。
最後にチームは推論の失敗モードを検証した。短いテキスト列が推論トレース内でどれだけ繰り返されるかを示す反復スコアを、推論の長さと比較した。両者はしばしば同じ方向に増える。モデルの推論が長くなるほど反復率は高くなる。長いトレースの多くは代替案の探索ではなく、同じ数ステップを繰り返し巡り、32,000トークンの予算を使い切って停止し、答えすら与えない、いわゆる「doomlooping」だ。Qwen3.5-4Bが最も明白な例で、しばしば10,000〜25,000トークンを推論に費やすが、それが必ずしも性能向上につながるわけではない。目標言語で推論をプリフィルしても救えず、言語を強制したQwenは高トークン・高反復の領域にとどまる。総じてCohereは、データ混合戦略によって、言語内推論を言語ごとに構築する作業から、データ設計によって実現できる能力へと変え、多言語推論データが乏しい場合でも達成に近づけると結論づけている。