翻訳待ち:Hitting a billion tokens per minute on one GPU by combining a query planner and an inference engine
AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Maximizing perf on AI-SQL queries with the KV-optimal left-deep join
Official AI infrastructure blog; confirm reuse terms before full body display.
AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Maximizing perf on AI-SQL queries with the KV-optimal left-deep join
AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Learn how we optimized performance and efficiency serving the workload that is changing software engineering forever — and you can too.
AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Recent product updates from Modal and news from around the community.
ファッションECブランド向けのビジュアル生成AIを手がけるBotikaは、社内で開発した基盤モデルと、100TBの画像データを処理するパイプライン、約15モデルの本番推論をすべてModal上で運用。CEOのEran Dagan氏は、Modalがなければ研究スピードやインフラ負担の面で現在の体制は実現できなかったと語る。
Modalは、ロンドンに新しいオフィスを開設し、欧州での事業拡大を図ります。同社はすでにストックホルムに約20人のエンジニアチームを擁しており、今回ロンドンでGTMチームを立ち上げ、将来的にはエンジニアリングなどの機能も拡張する予定です。Black Forest LabsやLegoraといった欧州のAI企業、DoorDashなどのグローバルプラットフォームがModalを利用しています。
AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Qwen3.8-2.4T-A95B by Alibaba, with a 1M token context window, is now available via Modal Auto Endpoints.
AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Modal’s Function Call data path is now >50ms faster. Our new routing layer is geographically distributed, so you can further reduce your network overhead.
Hugging Faceが最近のエージェント侵入の技術的なタイムラインを公開し、Modalをサードパーティのインフラとして指摘しました。Modalのプラットフォームと分離は侵害されていません。
Moonshotが2.8兆パラメータのマルチモーダルモデルKimi K3をリリースし、Modal上で毎秒460トークンの速度で動作可能になりました。混合エキスパートアーキテクチャ、100万トークンのコンテキストウィンドウ、ネイティブビジョンを備え、カスタムDFlash投機デコーダにより推論速度が大幅に向上しています。
CognitionのAIソフトウェアエンジニアDevinが、Devin Outpostsを通じてModalサンドボックス内で実行可能になりました。GPUサポートと高速コールドスタートを備えたカスタム環境を実現します。
Thinking Machinesが汎用マルチモーダルモデルInklingをリリース。テキスト、画像、音声入力に対応し、ModalのManaged Endpointとしてトークンベースの価格で利用可能。本記事では、局所注意機構アーキテクチャとDFlash投機的復号の利点について解説。
サーバーレスGPUと予約GPUの料金を比較するには、アプリケーションのピーク対平均比に注目します。本記事では、ピーク対平均比が予約の割引率を超える場合、サーバーレスGPUの方が低コストになることをモデルで説明し、その前提と限界について考察します。
マルチトークン残差予測(MRP)は、拡散言語モデル向けの軽量モジュールで、隣接するデノイジングステップ間の残差を予測します。静的推論では最大1.56倍の無損失高速化、動的推論では最大+16ポイントの品質回復を実現します。
Anthropicは生命科学研究向けのAIワークベンチClaude Scienceを発表。Modalの弾力的な計算インフラを統合し、研究者が会話の中でデータ処理から分子設計までの計算負荷の高いワークロードを直接実行できるようにする。
Modal社が、LLM推論などのレイテンシに敏感なアプリケーション向けに設計された新たな超低遅延サーバーレス製品「Serverless Servers」の内部構造を解説。独自プロキシfprsをPingoraで構築し、Envoyをエッジに、Spannerを設定管理に用いるアーキテクチャの決定理由を詳述。
ModalとDecagonは、投機的デコードを用いて推論レイテンシを100ミリ秒削減し、専用プロバイダを上回りました。本記事では、通信遅延、ホストオーバーヘッド、プリフィル遅延、デコード遅延の最適化を含む低レイテンシのプレイブックを詳述し、特にカスタム投機的デコードモデル(DFlash)による大きな成果に焦点を当てています。
Modal は Auto Endpoints をリリース。これはプロダクショングレードの LLM 推論へのセルフサービスの入口で、単一のコマンドで最先端のオープンモデルをデプロイし、推論コード、メトリクス、インフラを完全に制御できます。Modal の AI インフラプラットフォーム上に構築され、高性能オートスケーリング、カスタムコンテナランタイム、グローバル GPU 利用、および超低レイテンシルーティング(5ms オーバーヘッド)を実現する Modal Servers を備えています。トップチームの経験に基づく事前調整済みレシピと DFlash 投機的デコードを内蔵。将来は推論エンジニアリングの完全自動化を目指します。
Modalは投機的デコードに全力を注いでおり、これが最も重要な推論最適化手法であると主張しています。彼らはQwenモデル向けの最先端DFlash投機器をリリースし、5~20%の追加高速化を達成しました。本記事では、投機的デコードの原理、従来の最適化との比較、シミュレーションや数理モデルによる加速効果の説明を行っています。
本稿では、大規模言語モデルの後学習における強化学習の実践について説明し、現在のボトルネックはアルゴリズムではなくインフラストラクチャであると指摘します。Modalは大規模なRL後学習の経験を共有し、オープンソースライブラリがマルチノードトレーニング、環境管理、GPU利用率などの主要な問題を解決する方法を紹介します。
Modal は、Team および Enterprise プランの全ユーザー向けに、Environment を基盤としたロールベースアクセス制御(RBAC)を導入し、人間と AI エージェントのきめ細かな権限管理を実現します。
Modalは、General CatalystとRedpointが主導するラウンドで、46.5億ドルの評価額で3.55億ドルを調達しました。同社は9月以降に5倍成長し、年換算収益が3億ドルを超えました。ModalはAIワークロード向けに構築されたクラウドプラットフォームで、弾力的な推論、エージェントランタイム、サンドボックスに焦点を当てています。資金は低レイテンシ推論、強化学習、エージェントコンピュートの拡大に使用されます。
Applied Computeは、DoorDash、Cognition、Mercorなどの企業向けに強化学習を用いてカスタムAIエージェントを訓練し、Modal上で運用しています。その核心理念は「特定知能」であり、専有データで訓練し、使用ごとに改善されます。本稿では、RLトレーニングループ、インフラストラクチャの選択、Modalが提供する柔軟性、パフォーマンス、信頼性について説明します。
AnthropicとModalは、Claude Managed AgentsとModal Sandboxesの統合を発表しました。これにより、開発者はカスタマイズ可能なサンドボックスでツール呼び出しを実行でき、高速起動、コスト効率、拡張性を実現します。Mason AI、DoorDash、Blendなどの初期採用者が利点を共有しています。
Modal は4つの主要技術により、GPU推論サーバーの起動時間を数十分から数十秒に短縮し、真のサーバーレスGPUを実現しました。
ModalチームはSGLangスケジューラのプロファイリングにより、CUDA IPCプールハンドルの重複オープンがボトルネックであることを発見。単純なPython辞書キャッシュに置き換えることで、Qwen2.5-VL-3Bモデルでスループット16.2%向上、レイテンシ10%以上削減を達成。この最適化はSGLang v0.5.10にマージされました。
AE StudioはModalプラットフォームを活用し、進化戦略(ES)とGRPOの2つの強化学習手法を用いて言語モデルに数学の定理証明を学習させました。Lean検証器を使用し、Modalの並列GPU、サンドボックス分離、ボリュームストレージ機能により実験を効率的に実行。初期結果では、ESがいくつかのシナリオでGRPOに匹敵または上回る性能を示し、コストも大幅に削減されました。
ModalがOpenAI Agents SDKの公式サンドボックスプロバイダーになりました。この記事では、セキュアで並列・スケーラブルな自動化のためにModalサンドボックスを統合したカスタムコーディングエージェントフレームワークをゼロから構築する方法を、Parameter Golfチャレンジを例に説明します。
ModalはAutoresearchと統合し、弾力的なGPUスケーリングを提供し、AIエージェントが動的に計算リソースをプロビジョニングできるようにします。Parameter Golfチャレンジでは、エージェントが238 GPU時間で113の実験を実行し、単一ワークステーション比で5倍の高速化を達成し、専用クラスターのリソースのごく一部しか使用しませんでした。
Modal は AI サンドボックス技術企業 Butter の買収を発表。創業者の Erik Dunteman 氏と研究者の Raymond Tana 氏が Modal サンドボックスチームに加わります。Butter はエージェントエンジニアリングの経験を持ち、Zig で構築された軽量な一時的サンドボックス bVisor を開発しました。
Physical Intelligence は Modal プラットフォームを活用し、QUIC ベースの専用トランスポートプロトコルにより、ロボット向けの低遅延リモートリアルタイム推論を実現。ネットワークオーバーヘッドはわずか 10~15 ミリ秒で、大規模モデルの実験も容易。