本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

Thinking MachinesのInklingがModalで利用可能に

記事の要約

Thinking Machinesが汎用マルチモーダルモデルInklingをリリース。テキスト、画像、音声入力に対応し、ModalのManaged Endpointとしてトークンベースの価格で利用可能。本記事では、局所注意機構アーキテクチャとDFlash投機的復号の利点について解説。

ソースModal Blog
Thinking MachinesのInklingがModalで利用可能に
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

2026年7月15日、Thinking Machinesは汎用マルチモーダルモデル「Inkling」を発表しました。このモデルはテキスト、画像、音声の入力を受け付け、テキスト出力を生成します。総パラメータ数は9750億、アクティブパラメータは410億で、100万トークンのコンテキストウィンドウを備えています。Mixture-of-Expertsアーキテクチャを採用し、設計当初から広範なタスクへの対応を重視しており、追加学習に適したベースモデルとなっています。

Inklingの特徴は、局所注意(local attention)レイアウトにあります。6層の注意機構のうち5層がスライディングウィンドウ注意を用いて最近のトークンに焦点を当て、残り1層だけが全系列にわたるグローバル注意を行います。これにより、計算リソースを最近のトークンに集中させ、効率を高めています。ModalはInklingのリリースと同時にManaged Endpointを提供し、カスタムDFlash投機器を統合しました。8基のB200 GPU上でのエージェント系ワークロードにおいて、ユーザーあたり毎秒250トークン、GPUあたり毎分250万トークンのスループットを達成し、モデル内蔵の投機的復号経路よりも67%高速なインタラクティブ応答を実現しました。

DFlashはZ Labが開発した投機的復号技術で、ブロック拡散ドラフター(block diffusion drafter)を用いて、1回の並列フォワードパスでトークンブロック全体を生成します。従来のマルチトークン予測(MTP)ヘッドが1トークンずつドラフトするのに対し、DFlashはブロック全体を一括で生成するため、GPUの時間とメモリを節約できます。ModalチームはDFlashをさらに最適化し、すべてのドラフター層をスライディングウィンドウ注意のみとし、因果的層に変更することで、trtllmなどの高度に最適化されたカーネルを推論時に利用可能にしました。

Modalは、ブロック拡散ドラフティングが将来の投機的復号の主流アーキテクチャになると考えており、Inklingのようなモデルが増えるにつれてDFlashの性能をさらに追求する方針です。Inklingは現在、Modal Auto Endpointsを通じてOpenAI互換の共有エンドポイントとして利用可能で、トークンベースの価格設定が採用されています。ぜひお試しください。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • Thinking MachinesがInklingをリリース。総パラメータ975B(活性化41B)、マルチモーダル、1Mトークンコンテキスト。
  • Inklingは局所注意レイアウトを採用。6層中5層がスライディングウィンドウ注意で計算効率を向上。
  • ModalではカスタムDFlash投機器を統合し、8x B200で毎秒250トークンのスループットを実現。
  • DFlashはブロック拡散ドラフティングによりトークンブロックを並列生成し、従来の複数トークン予測ヘッドより高速。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。