AI News HubLIVE
公開記事 37収集記事 48信頼度 82更新頻度 120 分
稼働状態 正常ソース種別 公式全文利用権限 公式全文最終取り込み 2026-08-04ID baseten-blog状態 有効

Official AI inference and deployment platform blog; confirm reuse terms before full body display.

最新公開記事

翻訳待ち:Introducing NVIDIA Nemotron 3.5 ASR Streaming

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:AI models Introducing NVIDIA Nemotron 3.5 ASR Streaming Deploy NVIDIA Nemotron 3.5 ASR for low-latency, production-ready speech recognition with 6x higher throughput and multilingual support. Authors Ansel Erol Ian Carr…

  • AI 生成が一時的に利用できないため、ソース内容とフォールバックメタデータを保存しました。
  • AI models Introducing NVIDIA Nemotron 3.5 ASR Streaming Deploy NVIDIA Nemotron 3.5 ASR for low-latency, production-ready speech recognition with 6x higher throughput and multiling…
サイト内本文

翻訳待ち:Laguna S 2.1 goes Greek: a repository-scale game transformation

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:AI models Laguna S 2.1 goes Greek: a repository-scale game transformation We put Poolside’s new Laguna S 2.1 model to the test, tasking it with a repository-scale transformation of the open-source game Hypersomnia. Auth…

  • AI 生成が一時的に利用できないため、ソース内容とフォールバックメタデータを保存しました。
  • AI models Laguna S 2.1 goes Greek: a repository-scale game transformation We put Poolside’s new Laguna S 2.1 model to the test, tasking it with a repository-scale transformation o…
サイト内本文

Qwen3-TTSをファインチューニングして高品質な声質クローンを実現

Qwen3-TTSをファインチューニングして高品質な音声クローンを実現する方法を解説し、ICL、話者埋め込みのみ、ファインチューニングの3手法を比較しながら完全なトレーニング手法を紹介します。LJ Speechデータ約1.5時間を使用し、単一のH100で約1時間のトレーニングで、TTFAは約130msとなり、ICLより約16%高速化し、推論時の参照音声処理が不要になります。

  • Qwen3-TTSはICLと話者埋め込みのみのゼロショット音声クローンに対応するが、より高品質なクローンにはファインチューニングが必要。
  • ファインチューニングでは、発話単位のテキストと音声ペアでSFTを行い、重心話者埋め込みをモデル重みに組み込むため、推論時に参照音声が不要になる。
サイト内本文

22,580:GPT-2からKimi K3へ、その発展を解説

本記事は、GPT-2(1.24億パラメータ)からKimi K3(2.8兆パラメータ)へのアーキテクチャ進化を追跡し、7年間で22,580倍の規模拡大を実現した経緯を解説します。KVキャッシュ、線形注意、DeltaNetなどの主要な革新を説明し、巨大な規模に対応するために基礎メカニズムがどのように進化したかを明らかにします。

  • GPT-2は1.24億パラメータ、Kimi K3は2.8兆パラメータで22,580倍の増加。
  • KVキャッシュは再計算を回避するが、系列長に比例して増大。
サイト内本文

任意のハーネスでKimi K3を実行する方法:Baseten Switchによるルーティング

Baseten Switch はローカルのMacアプリで、Claude CodeやCodexなどの人気ハーネスでオープンモデルとクローズドモデルをシームレスに混在させ、Kimi K3やGLM 5.2などのモデルを切り替えながら、コスト、パフォーマンス、使用状況を追跡できます。

  • Baseten SwitchはGoで書かれたローカルMacアプリで、モデル間のリクエストをルーティングします。
  • Claude CodeやCodexなどのハーネスで、オープン/クローズドモデルをライブ切り替え可能。
サイト内本文

BasetenがModel Labs向けプラットフォームを発表

Basetenは、クローズドウェイトモデルラボ向けの新プラットフォーム「Baseten for Model Labs」を発表。推論インフラ、モデル配布、知的財産保護、およびマーケット投入支援を提供し、ラボのモデル収益化を迅速化する。Cartesia、Gradium、Inception、NVIDIAなど15のラボパートナーが参加している。

  • Baseten for Model Labsはクローズドウェイトモデルラボに推論、配布、収益化のワンストップサービスを提供。
  • 本番向け推論インフラ、モデルライブラリ配布、IP保護、共同GTM支援を含む。
サイト内本文

Kimi K3のトークン化を18倍高速化、百万トークンのエージェントワークロード向け

Basetenは新しいトークナイザー(Basetenkenizer)を導入し、Kimi K3のトークン化を百万トークンのエージェントワークロードで最大18倍高速化します。Rustベースの最適化(特殊化された事前トークン化、BPEマージ、マルチコアチャンク処理、ゼロコピーNumPy転送など)を組み合わせ、tiktokenと完全に同じトークンIDを維持します。この改善により、長い入力シーケンスの最初のトークンまでの時間が大幅に短縮され、特にプレフィックスキャッシュヒット率が高い場合に効果的です。

  • Baseten Tokenizerは、Kimi K3の百万トークンシーケンスのトークン化を最大18倍高速化します。
  • 最適化には、特殊化された事前トークン化、スタック常駐BPEマージ、マルチコア並列化、ゼロコピーNumPy所有権転送が含まれます。
サイト内本文

Kimi K3のDay-0 APIを構築する方法

Basetenは、2.8Tパラメータの新しいオープンフロンティアモデルKimi K3に対してDay-0サポートを提供します。この記事では、ハードウェア構成、重みのロード、推論エンジンの統合、品質検証、パフォーマンス最適化、および大規模展開を含む、モデルを起動日までに実行するために必要な技術的作業について説明します。

  • Kimi K3は2.8Tパラメータのオープンモデルで、Kimi Delta AttentionやStable LatentMoEなどの新しいアーキテクチャを採用。
  • BasetenはInferactおよびRadixArkチームと協力し、vLLMとSGLangでKimi K3をサポート。
サイト内本文

GLM 5.2 Fastのご紹介

リアルタイムのエージェントワークロード向けに最適化された新しいモデルAPI階層、GLM-5.2 Fastを発表します。標準のGLM-5.2と同じ重みを持ちながら、ユーザーあたりのスループットに調整されたインフラ上で動作し、低レイテンシと安定したパフォーマンスを提供します。

  • GLM-5.2 Fastは、標準のGLM-5.2と同じ重みを持つ独立したモデルAPI階層であり、インフラがリアルタイムアプリケーション向けに最適化されています。
  • エージェントワークフローでメインエージェントとしてサブタスクを調整し、レイテンシの累積を低減します。
サイト内本文

H100 vs H200 GPU 比較

この記事では、H100とH200のGPUをAI推論の観点から比較します。H100は中小規模のモデルや低トラフィックに適したコスト効率の良い選択肢です。H200は大容量のHBM3eメモリと高帯域幅を備え、超大規模モデルや長コンテキスト推論、KVキャッシュを多く必要とするワークロードに適しています。MIGや非同期プログラミングなどの技術も紹介します。

  • H100は中小モデルや低トラフィックに適したコスト効率の良い選択肢。
  • H200は大容量メモリと高帯域幅で大規模モデルや長コンテキストに最適。
サイト内本文

LLM推論速度の最適化と本番環境でのコスト削減方法

LLM推論のレイテンシとコストを削減するための様々な手法(連続バッチ処理、投機的復号、量子化、カーネル最適化、インテリジェントルーティング、トポロジ認識並列処理、プリフィルとデコードの分離)を解説。ワークロードに応じた適切な組み合わせが重要。

  • 連続バッチ処理により、バッチ途中でのリクエスト追加が可能になり、待ち時間を削減。
  • 投機的復号は小規模モデルで候補トークンを生成し、大規模モデルが並行検証することでスループット向上。
サイト内本文

AIモデルの選び方:NotionとGammaから学ぶ教訓

NotionとGammaの経験から、AIモデル選択ではコスト、信頼性、タスクへの適合性を考慮し、オープンウェイトモデルを活用すべきことがわかる。最も強力なモデルをデフォルトで使うのではなく、ワークフローに応じて最も効率的なモデルを選ぶ。

  • 単一のモデル非依存ハーネスは避け、各モデルのネイティブハーネスをユースケースに合わせて修正すべき。
  • モデル切り替えはエンジニアリングコストに見合う価値がある。信頼性、コスト柔軟性、新モデル迅速採用のため。
サイト内本文

GLM 5.2 ビジョン機能搭載

研究者らは、5000万パラメータの小さなMLPプロジェクターのみを訓練することで、オープンソース言語モデルGLM 5.2に視覚機能を追加することに成功し、MMMU-ProでClaude 4.5 Haikuに匹敵する性能(55%)を達成しました。このプロセスではSFTとRLを用い、グロッキング現象が観察され、未学習の画像に対する一般化も示されました。

  • 50Mパラメータの2層MLPを用いてGLM 5.2に後から視覚機能を付与。
  • MMMU-ProでClaude 4.5 Haiku相当の性能を達成し、テキスト能力は低下せず。
サイト内本文

Baseten でのリアルタイム動画生成推論:53.6倍の高速化

Baseten のモデルパフォーマンスチームは、タイムステップ蒸留、カスタムカーネル最適化、NVFP4 量子化により、Wan 2.2 の動画生成をクリップあたり 2.75 秒に短縮し、ベースライン実装比 53.6 倍の高速化を達成しました。

  • Wan 2.2 動画生成が 2 分以上から 2.75 秒に短縮、コストは 31 分の 1 に
  • タイムステップ蒸留(4 ステップ)、カスタム自己注意カーネル(1.58 倍高速化)、NVFP4 量子化(1.5 倍高速化)を採用
サイト内本文

NVIDIA Nemotron 3 Embed による高速かつ正確な検索

NVIDIA が Nemotron 3 Embed シリーズの埋め込みモデルを発表。8B と 1B の2サイズを Baseten で提供開始。8B モデルは検索ベンチマークでトップ、1B モデルは95%の精度を維持しつつレイテンシとコストを大幅削減。turbopuffer との連携やファインチューニング手法も紹介。

  • NVIDIA Nemotron 3 Embed 8B および 1B モデルが Baseten で利用可能に。検索品質とインデックス速度を最適化。
  • 8B モデルは RTEB リーダーボードでトップ、1B モデルは95%の精度を維持し、NVFP4 版は Blackwell GPU で2倍のスループット。
サイト内本文

Inklingの紹介:Thinking Machines Labの新しいカスタマイズ可能なモデル

Thinking Machines Labは、テキスト、画像、音声をネイティブに処理する9750億パラメータのオープンウェイトマルチモーダルモデルInklingをリリースしました。混合専門家アーキテクチャにより、アクティブパラメータは410億で、パフォーマンスとコストのバランスを実現します。Basetenは初日から展開をサポートします。

  • Inklingは975BパラメータのMoEモデルで、アクティブパラメータは41B。
  • テキスト、画像、音声の入力に対応し、100万トークンのコンテキストウィンドウ。
サイト内本文

Step 3.7 Flashの紹介:大規模マルチモーダル推論

StepFunのStep 3.7 Flashは、1980億パラメータのスパースMoEビジョン言語モデルで、Basetenモデルライブラリでハードウェア効率の良い構成で利用可能になりました。マルチモーダル入力、256kトークンのコンテキストウィンドウ、柔軟な推論を備え、エージェントワークフローに最適です。FP8量子化により、4×H100 GPUでのデプロイが可能になり、コストを大幅に削減します。

  • 198BパラメータのMoEアーキテクチャ、トークンごとに活性化されるのは11Bのみ
  • 画像・動画入力と256kコンテキストをサポート
サイト内本文

Baseten上でNVIDIA Nemotron 3 UltraとLangChain Deep Agentsを使用したエージェント構築

NVIDIA Nemotron 3 UltraとLangChain Deep Agentsを組み合わせることで、Baseten上で約10倍低いコストでトップレベルのオープンモデルエージェント精度を実現します。本記事では、コンプライアンスレビューエージェントを構築するための設定方法を紹介します。

  • LangChainがNVIDIA Nemotron 3 Ultra向けにチューニングされたDeep Agentsハーネスプロファイルをリリース。ファインチューニングなしでトップ精度を達成。
  • BasetenのモデルAPIを介してデプロイし、主要なクローズド代替品と比較して約10倍低いコストを実現。
サイト内本文

H100 vs H200 vs B200:どのGPUを選ぶべきか?

H100、H200、B200各GPUは、メモリ、計算能力、コストにおいて異なるトレードオフがあります。モデルサイズ、トラフィック、予算に応じて最適なGPUを選びましょう。

  • H100はMIGで小規模モデルや断続的なトラフィックにコスト効率が良い。
  • H200はDeepSeek-R1のような超大規模モデルを単一ノードで実行可能。
サイト内本文

AIトレーニングと推論:その違いは?

AIトレーニングはモデルがデータから学習するプロセスであり、推論は学習済みモデルが本番環境でリクエストに応答することです。本記事では、ハードウェア、コスト、最適化における主要な違いを詳しく説明し、モデルのライフサイクル(事前学習からサービス提供まで)や推論性能を測る4つの指標についても紹介します。

  • トレーニングはモデルが大量データから学習し重みを調整するプロセスで、多くの計算リソースを要します。
  • 推論は学習済みモデルが新しい入力に対して出力を生成するプロセスで、ユーザーリクエストのたびに発生します。
サイト内本文

任意のハーネスでGLM-5.2を実行する方法

GLM-5.2は今年のDeepSeekモーメントであり、クローズドソースモデルと同等の品質でありながら、4.5倍高速、5倍低コストです。この記事では、Claude Code、Codex、Deep Agents CLIでGLM-5.2を5分以内にセットアップする手順を詳しく説明します。

  • GLM-5.2はOpus 4.8などのクローズドモデルを代替できる高性能オープンソースモデル
  • Claude Codeでは環境変数を編集してGLM-5.2を使用
サイト内本文

NVIDIA BioNeMo Agent Toolkit が Baseten で利用可能に

NVIDIA BioNeMo Agent Toolkit は、汎用 AI エージェントを生物学や医薬品発見の実際のタスクを実行できる科学エージェントに変えるものです。このツールキットは、BioNeMo Skills、オープンモデル、NVIDIA NIM マイクロサービス、およびエージェントインフラストラクチャを組み合わせ、タンパク質構造予測、タンパク質設計、バーチャルスクリーニング、ゲノミクス解析、ターゲット発見などのワークフローを可能にします。すべての BioNeMo NIM マイクロサービスは Baseten モデルライブラリで利用可能であり、開発者は科学 AI アプリケーションを容易にデプロイおよびスケールできます。

  • NVIDIA BioNeMo Agent Toolkit は、汎用 AI エージェントを生物学および創薬のための科学エージェントに変換します。
  • BioNeMo Skills、オープンモデル、NVIDIA NIM マイクロサービス、エージェントオーケストレーションインフラを統合。
サイト内本文

最高のオープンソース大規模言語モデル(LLM)

DeepSeek V4 Pro、Gemma 4、GLM 5.1、GPT OSS 120B、Kimi K2.6、MiniMax M3、Nemotron 3 Ultra、Qwen 3.6 の8つのトップオープンソースLLMを比較。エージェントコーディング、長文脈推論、コスト、速度に最適なモデルを見つけます。

  • Kimi K2.6 は最もバランスが良く、Qwen 3.6 と GLM 5.1 はエージェントコーディングでリード。DeepSeek と Nemotron は長文脈・エンタープライズワークロードで強み。GPT OSS 120B はコストと速度で優れる。
  • DeepSeek V4 Pro は 100万トークンのコンテキストウィンドウを持ち、CSA と HCA により KV キャッシュメモリを標準モデルの約2%に削減。
サイト内本文

ダウンタイムなしのモデル更新を実現するローリングデプロイ

Baseten がローリングデプロイを発表。チームは GPU コストを倍増させたりダウンタイムを発生させることなく、段階的にモデルバージョンを更新できる。レプリカを1つずつ置き換え、トラフィックを徐々に移行。一時停止、再開、ロールバックも可能。顧客はデプロイ頻度が50~60%向上し、オフピーク時の手動監視が不要になった。

  • ローリングデプロイはレプリカを段階的に置き換え、ブルーグリーンの2倍GPUコストやハードカットオーバーのオール・オア・ナッシングリスクを回避。
  • max_surge(新レプリカ優先拡大)と max_unavailable(旧レプリカ優先縮小)の2モードを提供。
サイト内本文

初の推論拡散LLM「Mercury 2」がBasetenで利用可能に

Inceptionが開発したMercury 2は、拡散アーキテクチャを採用した最速の推論LLMです。従来の自己回帰モデルとは異なり、並列処理により標準NVIDIA GPU上で毎秒1000トークン以上の生成速度を実現。速度は同等クラスのモデルより5〜10倍高速で、コストは半分以下、品質はHaikuやGPT-5 miniに匹敵します。Augment Codeは本番環境で使用し、コストを90%、レイテンシを82%削減しました。Basetenがエンタープライズ級の推論プラットフォームを提供します。

  • Mercury 2は初の推論拡散LLMで、出力全体を並行生成し徐々に洗練することで、自己回帰モデルの逐次生成のボトルネックを解消。
  • 標準NVIDIA GPU上で毎秒1000トークン以上、専用チップ不要で、最適化済みモデルの5〜10倍の速度。
サイト内本文

NVIDIA Nemotron 3 Ultra のご紹介:Nemotron 3.x ファミリーが登場!

Nemotron 3 Ultra は、長時間実行されるエージェント向けに設計されたハイブリッドMamba-Transformerモデルです。ほとんどのアテンションをMamba層に置き換えることで、最大5倍の推論速度向上と30%のコスト削減を実現。完全にオープンであり、エージェントが遅くなることなく長いタスクを効率的に完了できます。

  • Nemotron 3 Ultra は、主にMamba層を使用したハイブリッドアーキテクチャを採用し、コンテキストが増加しても一定の推論速度を維持します。
  • 長時間実行されるエージェントワークフローにおいて、オープンフロンティアモデルと比較して最大5倍の推論速度向上と30%のコスト削減を実現。
サイト内本文

MAI-Thinking-1 が Baseten に登場

Baseten とマイクロソフト AI は、MAI-Thinking-1 が Baseten で利用可能になることを発表しました。このモデルは、オープンソースの柔軟性とクローズドモデルの管理の利便性を組み合わせ、クリーンなデータ系列、商用グレードの品質、カスタマイズオプションを提供します。

  • MAI-Thinking-1 は、オープンソースとプロプライエタリモデルの間を埋めるマイクロソフト AI の新推論モデルです。
  • 第三者モデルからの蒸留なしで厳選されたデータでトレーニングされ、クリーンなデータ系列を実現。
サイト内本文

Nvidia Cosmos 3:ロボットがついに主役に

Nvidiaが発表したCosmos 3は、物理世界の動作を理解し、ロボットや自律システムの開発を支援するために設計された基盤モデルです。従来の動画生成モデルとは異なり、物体の挙動や因果関係を学習し、テキスト、画像、動画、音声、アクションを統合的に扱います。ロボットの直接制御や、訓練データ生成のためのデータ工場として利用でき、ロボット訓練のコストを大幅に削減します。

  • Cosmos 3は物理世界の理解に特化した世界基盤モデルです。
  • テキスト、画像、動画、アクションの6つのモードをサポートします。
サイト内本文

継続学習時代の推論を支える

BasetenとTrajectoryは、本番トレースからモデルを継続的に更新するための本番グレードの推論パイプラインを構築しました。トレーニングからデプロイまでの時間を約1時間に短縮し、使用とともに改善されるモデルを実現します。

  • 継続学習により、モデルは静的なリリースではなく本番での使用から継続的に改善されます。
  • BasetenとTrajectoryは、LoRAアダプターのマージ、検証、A/Bルーティングとプロビナンス追跡を備えたパイプラインを開発。
サイト内本文

オープンソースAIモデル入門ガイド

オープンソースAIモデルの基本概念、動作原理、使用シーンを解説。オープンウェイトモデルの微調整や独自デプロイの利点、クローズドソースモデルとの比較、コスト削減効果、将来の展望について包括的に紹介します。

  • オープンソースモデルは主にオープンウェイトモデルを指し、微調整や自己ホスティングが可能。
  • クローズドソースモデルと比較して平均87%のコスト削減を実現。
サイト内本文

全ソース