OpenLanguageModel: 教育と研究のための読みやすく構成可能な小言語モデルの事前学習
OpenLanguageModel (OLM) は、小規模言語モデルの構築と事前学習を可能にするオープンソースのPyTorchライブラリであり、その内部機構を可視化します。モデルコードはアーキテクチャを直接反映し、Block、Residual、Repeat、Parallelなどのコンポーネントが配線を記述します。OLMは、トークナイザ、データセット、最適化、混合精度、コールバック、チェックポイント、ハードウェア対応実行を統合し、教育用ノートブックから本格的な事前学習へのシームレスな移行を実現します。ライブラリは9つのモデルファミリーにわたる27のプリセットを備え、LM基礎からアーキテクチャ研究までカバーするドキュメントが付属します。検証では、独立したリファレンス実装との高い一致、348Mパラメータモデルにおける4GPUでの90.6%の弱スケーリング効率、そして良好なユーザビリティ結果が示されています。OLMはMITライセンスで提供され、PyPI、GitHub、およびドキュメントサイトから利用可能です。
OpenLanguageModel(OLM)は、小規模言語モデルの構築と事前学習を目的とした、オープンソースのPyTorchライブラリです。その最大の特徴は、モデルの内部動作を完全に可視化できる点にあります。モデルのコードはアーキテクチャ図をそのまま読むかのように設計されており、Block、Residual、Repeat、Parallelといったコンポーネントが、どのように接続されているかを直接記述します。この設計により、教育用のJupyterノートブックで使われたモデルを、そのまま本格的な事前学習ジョブや研究のアブレーション実験に移行することが可能です。
OLMはモデル定義だけでなく、事前学習のための完全なパイプラインも提供します。トークナイザ、ローカルおよびストリーミングデータセット、最適化、混合精度、コールバック、チェックポイント、そしてCPU、単一GPU、単一ノード複数GPUに対応したハードウェア認識実行を統合しています。研究チームは、GPT-2のアーキテクチャ図からコードへのトレース、FineWeb-Eduデータセットを使った訓練スクリプトの起動、注意力コンポーネントの交換、AutoTrainerによる自動ハードウェア設定など、具体的なユースケースを通じてその機能を実証しています。
ライブラリには、9つの代表的なモデルファミリーにわたる27のプリセットが組み込まれており、言語モデルの基礎からアーキテクチャ研究に至るまで段階的なドキュメントが用意されています。検証結果は優れており、独立したリファレンス実装との高い一致、3億4800万パラメータモデルにおける4GPUでの90.6%の弱スケーリング効率、コンパクトなアーキテクチャ編集、そして初期ユーザビリティ調査での肯定的なフィードバックが報告されています。
OLMはMITライセンスの下で公開されており、PyPI、GitHub、および専用のドキュメントサイトから入手できます。教育者、学生、研究者にとって、小規模言語モデルを理解し、実験し、革新するための強力なツールとなることでしょう。本論文は2026年7月18日にarXivに提出され、著者はTavish Mankashら4名、全8ページ、3図、1表から構成されています。