このarXiv論文はArif Adito氏によって2026年7月27日に提出され、arXiv:2609.25008、cs.CL(計算と言語)に分類されている。著者は、チームを組まず、PyTorchも使わず、訓練経路にPythonも一切挟まず、純粋なRustだけで言語モデルをエンドツーエンドで事前訓練した経験を報告している。レンタルGPUの費用は合計164ドルだった。著者はこれを推奨ではなく一つの達成として位置づけ、より有用な貢献は、2026年時点で主要なRust機械学習フレームワークであるCandleとBurnを「推論」ではなく「訓練」バックエンドとして使った場合の、計測に基づく失敗分類だとする。
論文ではCandleの5つの欠陥が記録されている。その一つは、融合カーネルが静かに勾配をまったく生成しないというものだ。Burnについては3つの欠陥が報告され、逆伝播が理論上のGPUスループットの約3%しか出ないことや、カーネル融合経路が数十億パラメータ規模の訓練中にセグメンテーション違反を起こすことが含まれる。これらの欠陥はどれも自ら名乗り出ることはなく、通常の損失曲線の検査をすべて通過してしまった。これに対処するため、著者は検証規律を記述している。中心となるのは「勾配フローアービター」と呼ばれるテストで、1回の順伝播と逆伝播を実行し、すべての訓練可能パラメータが有限で非ゼロの勾配を受け取ることを表明する。このテストは任意のフレームワークに一般化でき、6件の同種の静かな失敗を捕まえた。
訓練されたモデルは約0.4Bパラメータで、ベンガル語を優先している。ベンガル語の言語モデリングでは明確な信号を示し、トークンあたり負の対数尤度は0.93だった。ランダムに初期化した双子モデルでは12.60である。一方、英語の常識多肢選択ではチャンスレベルにとどまる。これは意図的に小さくベンガル語に重みを置いた予算、すなわち約20億トークン、54.6時間、レンタルしたH100 1枚という条件から予想される結果である。著者はさらに、ベンガル文字における「トークナイザ肥沃性トラップ」を報告している。素朴なバイトレベルトークナイズでは、ベンガル語は約1.4文字/トークンに圧縮され、英語の3.9文字/トークンと比べてコーパスの言語バランスを静かに逆転させてしまう。修正後は約4.1文字/トークンに達した。
著者の知る限り、これは純粋なRustによるエンドツーエンド言語モデル事前訓練の最初期の記録の一つである。ただし今回の実行後、著者は訓練をPyTorchに移し、Rustはオンデバイスサービングのために残した。著者の手元では、Rustはまだ言語モデルを訓練する競争力のある場所ではないが、言語モデルを提供する場所としては良い可能性がある、というのが結論である。