2026年、小型言語モデル(SLM)はリソース制約のある本番環境において実用的な選択肢として確立されました。オープンソースの大規模言語モデルをセルフホスティングする際、多くのチームがGPUの限界に直面します。VRAMは急速に消費され、KVキャッシュはリクエストごとに増大し、同時実行数が増えるとレイテンシが急上昇します。デモでは問題なく動作していたモデルが、本番では複数のハイエンドGPUを必要とすることも珍しくありません。この課題を回避するため、GPT-5のようなプロプライエタリモデルにAPI経由で依存する選択肢もありますが、ベンダーロックイン、カスタマイズの制約、スケールに応じた予測不能な価格、データプライバシーの懸念などのトレードオフがあります。そのため、再びセルフホスティングへの回帰が進んでいます。幸いなことに、近年の蒸留技術、高品質トレーニングデータ、ポストトレーニング手法の進歩により、小型モデルはパラメータ数から予想される以上に強力になり、多くのSLMが堅牢な推論、コーディング、エージェント性能を備え、単一GPUで快適に動作します。
以下、現時点で最高のオープンソース小型言語モデルを5つ紹介します。
Qwen3.5-0.8B:AlibabaのQwenシリーズに属する軽量マルチモーダルモデルで、0.8Bの因果言語モデルと視覚エンコーダを組み合わせ、思考モードと非思考モードの両方をサポートします。テキスト、画像、動画を一つのコンパクトなモデルで処理でき、軽量マルチモーダルアシスタント、文書理解、スクリーンショットQA、簡単な動画要約に適しています。ネイティブで最大262Kトークンのコンテキストをサポートし、長い文書や会話履歴、エージェントワークフローに有用です。200以上の言語をカバーしており、グローバル向け端末製品に最適です。ただし、0.8Bというサイズのため深い推論や複雑なコーディングには不向きであり、思考モードが不安定になることがあるため、本番環境では注意深いサンプリング調整とガードレールの設定が必要です。より多くの計算リソースが利用可能であれば、Qwen3.5-2Bや4Bへのアップグレードをお勧めします。
Gemma-3n-E2B-IT:Google DeepMindが開発した命令チューニング済みマルチモーダル小モデルで、端末や低リソース環境向けに設計されています。テキスト、画像、音声、動画の入力を処理し、選択的パラメータ活性化により、名目上のパラメータは約5Bですが、メモリ消費は従来の2Bモデルと同等です。140以上の言語でトレーニングされており、マルチモーダル機能が特に優れています。音声認識、画像説明、短い動画分析、通常のチャットを一つのモデルで行いたい場合に適しています。モバイルファーストのアーキテクチャにより、リアルタイムまたはニアリアルタイムのオンデバイス体験に適しています。注意点として、全モダリティで共有される入力コンテキストは32Kトークンであり、マルチモーダルトークンはコンテキストを急速に消費するため、長いセッションではプロンプトバジェットの管理が必要です。また、音声認識や翻訳の性能は言語やアクセント、ノイズによって異なるため、本番投入前に十分な評価が不可欠です。
Phi-4-mini-instruct:MicrosoftのPhi-4シリーズから派生した軽量命令チューニングモデルで、わずか3.8Bパラメータながら、推論と多言語性能でLlama-3.1-8Bなどの7B〜9Bモデルに匹敵します。高品質な合成データと厳選された公開データセットでトレーニングされ、MITライセンスで提供されるため商用利用に適しています。128Kトークンのコンテキストウィンドウをネイティブサポートし、文書分析、RAG、エージェントトレースに活用できます。ただし、世界知識が限定的であり、知識集約型のクエリやロングテールな質問に対して不正確な回答を生成する可能性があるため、本番ではRAGや外部ツールと組み合わせることを推奨します。さらに、多言語性能は英語以外でばらつきがあり、プロンプト形式に敏感なため、推奨されるチャットおよび関数呼び出し形式を厳守する必要があります。
SmolLM3-3B:Hugging Faceが完全にオープンソースで公開した命令・推論モデルです。3BのスケールでLlama-3.2-3BやQwen2.5-3Bを凌駕し、多くの4B級モデルと競合します。最大の特徴は透明性で、アーキテクチャの決定、データ構成、ポストトレーニング手法を含む完全な工学設計図が公開されています。「思考」と「非思考」のデュアルモードをサポートし、デフォルトでは高速応答を優先し、難しいリクエストにのみ推論コストをかけます。コンテキスト長は64Kで、YaRN拡張により128Kまで伸張可能です。ただし、対応言語が主に6つのヨーロッパ言語に限定されているため、より広範なグローバルカバレッジが必要な場合は注意が必要です。
Ministral-3-3B-Instruct-2512:Mistral AIが開発したマルチモーダルSLMで、3.4Bの言語モデルと0.4Bの視覚エンコーダを組み合わせ、基本的な視覚理解と関数呼び出しをサポートします。単一GPUで稼働し、FP8で約8GBのVRAMに収まります。256Kトークンの大規模コンテキストを備え、文書、ログ、複数ファイルの入力に適しています。視覚能力は限定的で、詳細な画像分析や複雑な視覚推論には向きませんが、スクリーンショット理解、画像キャプション、簡単な視覚QAなどの軽量タスクには実用的です。より強力なマルチモーダル推論が必要な場合は、同シリーズの推論バリアントを検討してください。
まとめると、SLMは通常100億パラメータ未満のモデルを指し、現代のSLMは多くのかつての本番ユースケースに十分対応できます。最大の利点はファインチューニングが容易でコストが低いことであり、特定のタスクに特化させることで汎用大規模モデルを凌駕することも可能です。ただし、世界知識や言語カバレッジには限界があるため、本番導入前にはユースケースに基づいた徹底的な評価が重要です。