2026年7月15日、Thinking Machinesは汎用マルチモーダルモデル「Inkling」を発表しました。このモデルはテキスト、画像、音声の入力を受け付け、テキスト出力を生成します。総パラメータ数は9750億、アクティブパラメータは410億で、100万トークンのコンテキストウィンドウを備えています。Mixture-of-Expertsアーキテクチャを採用し、設計当初から広範なタスクへの対応を重視しており、追加学習に適したベースモデルとなっています。
Inklingの特徴は、局所注意(local attention)レイアウトにあります。6層の注意機構のうち5層がスライディングウィンドウ注意を用いて最近のトークンに焦点を当て、残り1層だけが全系列にわたるグローバル注意を行います。これにより、計算リソースを最近のトークンに集中させ、効率を高めています。ModalはInklingのリリースと同時にManaged Endpointを提供し、カスタムDFlash投機器を統合しました。8基のB200 GPU上でのエージェント系ワークロードにおいて、ユーザーあたり毎秒250トークン、GPUあたり毎分250万トークンのスループットを達成し、モデル内蔵の投機的復号経路よりも67%高速なインタラクティブ応答を実現しました。
DFlashはZ Labが開発した投機的復号技術で、ブロック拡散ドラフター(block diffusion drafter)を用いて、1回の並列フォワードパスでトークンブロック全体を生成します。従来のマルチトークン予測(MTP)ヘッドが1トークンずつドラフトするのに対し、DFlashはブロック全体を一括で生成するため、GPUの時間とメモリを節約できます。ModalチームはDFlashをさらに最適化し、すべてのドラフター層をスライディングウィンドウ注意のみとし、因果的層に変更することで、trtllmなどの高度に最適化されたカーネルを推論時に利用可能にしました。
Modalは、ブロック拡散ドラフティングが将来の投機的復号の主流アーキテクチャになると考えており、Inklingのようなモデルが増えるにつれてDFlashの性能をさらに追求する方針です。Inklingは現在、Modal Auto Endpointsを通じてOpenAI互換の共有エンドポイントとして利用可能で、トークンベースの価格設定が採用されています。ぜひお試しください。