AI News HubLIVE
公開記事 36収集記事 37信頼度 88更新頻度 5 分
稼働状態 正常ソース種別 公式全文利用権限 公式全文最終取り込み 2026-08-07ID together-ai-blog状態 有効

Official source; confirm reuse terms before enabling full body display.

最新公開記事

翻訳待ち:DeepSeek-V4 Flash 0731 vs GPT-5.6 Luna on DeepSWE: Cost and Coding

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:We ran 900 DeepSWE rollouts on DeepSeek-V4 Flash and GPT-5.6 Luna. Luna leads pass@1 by 14 points; DeepSeek delivers 4.8x the solves per dollar.

  • AI 生成が一時的に利用できないため、ソース内容とフォールバックメタデータを保存しました。
  • We ran 900 DeepSWE rollouts on DeepSeek-V4 Flash and GPT-5.6 Luna. Luna leads pass@1 by 14 points; DeepSeek delivers 4.8x the solves per dollar.
サイト内本文

Kimi K3: 完全開発者ガイド

Kimi K3 は、Moonshot AI が開発した 2.8 兆パラメータのオープンウェイトモデルで、世界初の 3 兆パラメータ級オープンソースモデルです。本記事では、アーキテクチャの特徴、Together AI での呼び出し方、推論強度、視覚入力、構造化出力、ツール呼び出し、動的ツールロードなどを解説します。

  • Kimi K3 は 2.8 兆パラメータを備え、史上最大のオープンウェイトモデルであり、1M コンテキストに対応。
  • Kimi Delta Attention、Attention Residuals、Stable LatentMoE などの新アーキテクチャを採用し、896 エキスパート中 16 個のみを活性化。
サイト内本文

ThunderAgent:大規模合成データ生成のための2倍高速なエージェント推論

ThunderAgentは、エージェント推論のためのプログラム認識スケジューラです。各エージェントワークフローをスケジュール可能なプログラムとして扱うことで、KVキャッシュスラッシングを排除し、2倍以上のシングルノードスループットとほぼ線形のマルチノードスケーリングを実現します。

  • エージェントLLMリクエストスケジューリングのためのプログラム抽象化を導入し、KVキャッシュスラッシングを排除
  • シングルノードで最大2.5倍のスループット向上、8ノードクラスタで2.4倍の高速化を達成
サイト内本文

Together AI、Moonshot AIと戦略的パートナーシップを発表:Kimiモデルをネイティブ提供

Together AIはMoonshot AIと戦略的提携を結び、Moonshotのオープンモデルのローンチプラットフォームとなり、最初のモデルとして2.8兆パラメータのKimi K3を提供開始。

  • Together AIがMoonshot AIモデルのローンチプラットフォームとなり、初日アクセスとUSホスティングインフラを提供。
  • Kimi K3は2.8TパラメータのスパースMoEモデルで、ネイティブビジョンと1Mコンテキストを備え、Kimi Delta AttentionやAttention Residualsなどの革新的アーキテクチャを採用。
サイト内本文

専用モデル推論の設定

Together AIの専用モデル推論アーキテクチャの詳細ガイド:エンドポイント、デプロイメント、設定、容量ベースのルーティング。

  • システムはエンドポイント(固定名)、デプロイメント(モデル+ハードウェア)、設定(不変のレシピ)で構成される。
  • トラフィックルーティングは固定パーセンテージではなく、有効容量(重み×準備完了レプリカ数)に基づく。
サイト内本文

Kimi K3 vs Claude Fable 5:DeepSWEにおけるコストとコーディング性能の比較

DeepSWEベンチマークでKimi K3とClaude Fable 5の452回のロールアウトを実行しました。Fableはpass@1で1.4ポイントリードするものの、Kimi K3はpass@4で勝利し、1ドルあたりの解決タスク数で2.8倍の効率を達成。Kimi K3はオープンモデルとして、Fableの3分の1のコストで高い性能を提供します。

  • Kimi K3のpass@1は68.5%でFableの69.9%にわずかに劣るが、pass@2(82.0% vs 80.2%)とpass@4(89.4% vs 88.5%)で勝る。
  • Kimi K3のロールアウトあたりのコストは4.65ドルで、Fableの13.41ドルと比較して大幅に低く、1ドルあたりの解決タスク数は2.8倍。
サイト内本文

オープンウェイトAI推論の本番プラットフォーム

Together AIは推論プラットフォームの大幅なアップデートを発表し、パフォーマンス、コスト、品質を完全に制御できるようにしました。カナリアデプロイ、A/Bテスト、オートスケーリング、そして強化学習とファインチューニングを含むカスタムトレーニングのクローズドベータ版など、新機能が追加されています。

  • オープンウェイトモデルを数分で本番デプロイ、本番グレードの制御を提供
  • カナリア、ブルーグリーン、ローリングアップデートをサポート、自動ロールバック
サイト内本文

Together AI と Y Combinator が提携、YC コミュニティ向け初の専用 GPU クラスタを提供

Together AI と Y Combinator は、YC スタートアップ向けに専用 GPU クラスタを提供するパートナーシップを発表。計算ボトルネックを解決し、スタートアップは2年契約ではなく数週間単位でコミット可能。セルフサービスポータルを通じて直接 GPU を管理でき、YC の関与は不要。クラスタはフル稼働中で、単一ノードから大規模拡張まで対応。

  • Together AI と YC が初の専用 GPU クラスタを提供、YC スタートアップは直接計算リソースを利用可能。
  • コミット期間は数週間で、2年契約は不要。資本をビジネスの他分野に振り向けられる。
サイト内本文

推論における99.9%のアップタイムの意味とは?

この記事では、AI推論サービスの信頼性指標(99%、99.9%、99.99%)の実際の意味を分解し、各レベルが耐えなければならない障害ドメインと必要なアーキテクチャ要件を説明します。Together AIの著者らは、信頼性の高い推論インフラ構築の経験を共有し、プロバイダーを選ぶ前に尋ねるべき重要な質問を提供します。

  • 各信頼性レベルは特定の障害ドメインに対応:99%はノード障害、99.9%はデータセンター障害、99.99%はリージョン障害。
  • 高いアップタイムを達成するには、プロアクティブなヘルスチェック、複数施設へのデプロイ、予備容量が必要。
サイト内本文

Together GPUクラスターの新機能:プロダクションGPUクラスターの信頼性と制御

Together AIが、受動的健康チェック、ノード修復、強化されたSlurmの信頼性、OIDC、起動スクリプトにより、プロダクションGPUクラスターをどのように改善しているかをご紹介します。

  • Together AIは、障害を迅速に検出して回復するための受動的健康チェックと自動ノード修復を導入。
  • Slurm-on-K8s 2.0は、自己修復デーモン、永続的なジョブ会計、信頼性の高いプロセスクリーニングを提供。
サイト内本文

Together AI、Thinking Machines Labの新モデルInklingを初日から提供

Thinking Machines Labが、トークン効率的な推論、ネイティブなマルチモーダル理解、幅広いタスクの汎用性を備えたマルチモーダル混合専門家モデルInklingをリリースしました。Together AIは推論プラットフォームでこのモデルを提供し、制御可能な推論努力、テキスト/画像/音声入力、1Mコンテキストウィンドウをサポートします。

  • InklingはマルチモーダルMoEモデルで、総パラメータ数975B、トークンあたりアクティブパラメータ40B、コンテキストウィンドウ1M。
  • テキスト、画像、音声入力を受け付け、推論努力を調整可能で、コストとレイテンシのトレードオフを実現。
サイト内本文

オープンで便利、予測可能:Provisioned Throughputのご紹介

Together AIは、MiniMax M3やGLM-5.2などのフロンティアオープンモデル向けに、トークンベースの料金設定と99%のアップタイムSLAを備えた予約推論容量「Provisioned Throughput」を発表。専有APIと比較して最大90%のコスト削減を実現します。

  • 予約推論容量を提供し、GPU時間の計算やインフラ管理は不要。
  • トークンベースの料金設定で、1 PTUあたり1分間0.05ドル。
サイト内本文

オープンソースAIへの移行を加速するための8億ドルのシリーズCを発表

Together AIは、オープンソースAIへの移行を加速するため、8億ドルのシリーズC資金調達を完了した。同社は、クローズドモデルの経済性はスケールせず、フルスタック最適化と組み合わせたオープンモデルで6〜20倍のコスト削減が可能だと主張する。Together AIは、FlashAttention-4やTogether Megakernelなどの革新を立ち上げ、世界最大のAIトークンプロデューサーの1つとなった。

  • Together AIがシリーズCで8億ドルを調達し、オープンソースAIを加速
  • クローズドモデルのコスト構造は大規模利用では持続不可能
サイト内本文

Together AI、ICML 2026で全スタックにわたる最先端研究

Together AIはICML 2026で8本の論文が採択され、エージェントからGPUカーネルまでの全スタックの研究を発表。これらの研究はTogetherプラットフォームに統合され、本番環境ですでに活用されている。

  • 8本の論文がICML 2026に採択され、AIスタック全体をカバー。
  • DSGymはデータサイエンスエージェントの評価と訓練を統一するフレームワークで、1,000以上のタスクを提供。
サイト内本文

ParallelKernelBench:最先端LLMはまだ高速マルチGPUカーネルを書けない

ParallelKernelBenchは、LLMが87の実ワークロードに対して高速なマルチGPU CUDAカーネルを書けるかをテストするベンチマークです。最高のモデルでも3分の1未満しか解けず、ベースラインを上回ったのはさらに少ないですが、生成されたカーネルの中には既存の公開実装を凌ぐものもあります。

  • ParallelKernelBench(PKB)は実コードベースから抽出した87のマルチGPUカーネル生成問題で構成される。
  • 最高性能モデル(GPT-5.5)はゼロショット設定で28問を正解し、うち22問がベースラインより高速。
サイト内本文

Kimi K2.7 Code vs Claude Fable 5:ランディングページのコストを94%削減

Kimi K2.7 CodeとClaude Fable 5で12のランディングページを生成しました。Kimiのコストは94%低く、ほぼすべてのページで数ポイント以内のスコアでした。オープンソースモデルは単に安いだけでなく、品質でも競争力があり、その差は急速に縮まっています。

  • Kimi K2.7 CodeはClaude Fable 5と比較してランディングページ生成コストが約94%低い。
  • 品質スコアではKimiとFableの差は小さく、特にデザインインスピレーションMCPを使用した後は顕著。
サイト内本文

エンタープライズAIにおける信頼構築:Together AIがISO 27001:2022認証を取得

Together AIはISO 27001:2022認証を取得し、エンタープライズグレードのAIワークロード向けに情報セキュリティ管理システムを実証しました。既存のSOC 2準拠を補完します。

  • A-LIGNコンプライアンス&セキュリティよりISO 27001:2022認証を取得
  • 認証範囲はグローバルプラットフォーム、本社、サードパーティデータセンター
サイト内本文

MiniMax-M3の効率的な推論サービス:100万トークンコンテキストとマルチモーダルを後悔なく実現

Together AIは、KVブロックメジャースパースアテンション、ページ化MSAデコード、最適化されたインデックススコアリングカーネル、およびRustベースのマルチモーダル前処理ゲートウェイにより、MiniMax M3の効率的なサービスを実現し、同時実行レベル全体で81~125%のスループット向上を達成しました。

  • MiniMax M3は、コーディング、エージェントワークフロー、マルチモーダル推論を統合し、100万トークンのコンテキストウィンドウをサポートします。
  • Together AIの推論およびカーネルチームは、KVブロックメジャースパースアテンションカーネルやページ化アテンション統合などの革新的な最適化を実装しました。
サイト内本文

Together AIが世界最速の音声認識スタックを構築した方法

Together AIは、ASRを単なるGPU推論問題ではなく、システム全体の問題として捉えることで、Artificial Analysisで最速の音声認識スタックを実現しました。本記事では、実際の音声形状に対応したTensorRTマルチプロファイルエンジン、条件付きCUDAグラフによるCPU往復の排除、共有メモリによるデータコピー削減、イベント駆動I/O、そしてgc.freeze()によるGCテールレイテンシの除去など、最適化の詳細を解説します。

  • Together AIはGPU推論だけでなくシステム全体の最適化により最速の音声認識を達成。
  • 主要技術:TensorRTマルチプロファイルエンコーダ、条件付きCUDAグラフ、ゼロコピー共有メモリ、イベント駆動I/O。
サイト内本文

大規模推論ベンチマーク:コーディングエージェント

本番コーディングエージェントワークロードにおいて、Together Inference Engine は同一ハードウェア上で次に高速なOSSエンジンより31%高いTPSを実現し、飽和状態では2倍優れたTTFTを維持します。この改善は、ThunderMLA、カスタムカーネル書き換え、実トラフィックでのエンドツーエンドプロファイリングに基づくフルスタック最適化によるものです。

  • コーディングエージェント向け実世界推論ベンチマーク:TensorRT-LLMより31%高いTPS、飽和時2倍のTTFT、Claude Opus 4.6比76%低コスト。
  • フルスタック最適化:ThunderMLA融合カーネル、カスタムカーネル書き換え、エンドツーエンドプロファイリング。
サイト内本文

Together AIとPearl Research Labsが提携し、AI推論のコストを削減

Together AIはPearl Research Labsと提携し、Pearlネットワークを活用したGemma-4-31B-it-pearl用の割引推論エンドポイントを発表。有用な作業の証明(Proof of Useful Work)を利用して、AIワークロードを暗号資産の排出に変換することでコストを相殺します。

  • Together AIがPearl Research Labsと提携し、割引推論エンドポイントを提供。
  • 有用な作業の証明(Proof of Useful Work)技術により、AI推論と同時に暗号通貨をマイニング。
サイト内本文

Violin:言語の壁を破るオープンソースの動画翻訳スキル

Violinは、音声認識、大規模言語モデル翻訳、音声合成を組み合わせた完全オープンソースのAI動画翻訳ツールです。ウェブアプリ、CLI、エージェントスキルを提供し、動画コンテンツに関する質問応答やパーソナライズされた音声選択が可能です。Together APIを基盤とし、Whisper、DeepSeek、Cartesiaなどのモデルを利用し、MITライセンスで公開されています。

  • ViolinはASR、LLM翻訳、TTSを統合したオープンソースの動画翻訳ツール。
  • ウェブアプリ、CLI、エージェントスキルをサポート。
サイト内本文

ボイスファインダー — 600以上のボイスからアプリに最適な声を素早く見つける新ツール

ボイスファインダーは、自然言語プロンプトやアップロードした音声サンプルを使用して、Together AIのTTSモデルが提供する600以上のボイスを検索、マッチ、フィルタリング、試聴できるツールです。

  • 600以上のボイスを検索・フィルタリング・試聴可能
  • テキスト説明や音声サンプルで類似ボイスを検索
サイト内本文

HuggingFaceからあらゆるモデルをデプロイして推論する

GooseとTogetherの専用コンテナ推論を使って、1つのセッションで任意のHuggingFaceモデルをデプロイする方法を学びます。複雑なセットアップをスキップし、1つのプロンプトでモデルをリリース日に本番環境で実行できます。

  • GooseとTogetherの専用コンテナ推論により、リリース日にゼロ遅延でモデルをデプロイ可能。
  • 著者はNetflixのvoid-modelを公開日に1つのセッションでデプロイ。
サイト内本文

DeepSeek-V4の提供:なぜ100万トークンコンテキストが推論システムの問題なのか

DeepSeek-V4はハイブリッドアテンション設計(CSA、HCA、SWA)によりKVキャッシュを圧縮し、100万トークンコンテキストをモデルの課題から推論システムの課題へと変えました。Together AIのNVIDIA HGX B200における初期導入経験は、キャッシュポリシー、プレフィックスキャッシング、エンドポイント設定が長コンテキストワークロードのパフォーマンスにどのように影響するかを示しています。

  • DeepSeek-V4の圧縮スパースアテンション(CSA)と強圧縮アテンション(HCA)はKVキャッシュサイズを削減するが、推論エンジンは複数のキャッシュレイアウトを管理する必要がある。
  • スライディングウィンドウアテンション(SWA)は長コンテキストでボトルネックとなり、慎重なストレージ戦略が必要。
サイト内本文

大規模推論を効率化する基礎研究

AIが研究から生産へ移行するにつれ、AIネイティブチームの課題はモデル構築から、効率的で信頼性が高く大規模なモデル運用へとシフトしています。推論コストは生産AIシステムの総ライフタイムコストの80~90%を占めます。Together AIはFlashAttention-4やATLASなどの研究と、フルスタックのハードウェア最適化、インテリジェントなスケジューリングにより、効率的な推論を実現し、顧客のユニットエコノミクスを改善します。

  • 推論コストはAIシステム経済の大部分を占め、総ライフタイムコストの80~90%に達する。
  • Together AIがFlashAttention-4(cuDNN比最大1.3倍高速)とATLAS(適応型投機的復号により推論を4倍高速化)を発表。
サイト内本文

Together AIとAdaptionのパートナーシップを発表

Together AIとAdaptionは、Together Fine-TuningをAdaptive Dataにネイティブ統合する提携を発表。チームはデータセットの最適化、ファインチューニング、評価、デプロイを効率的に行えるようになります。

  • Together AIがAdaptionと提携し、ファインチューニングをAdaptive Dataに統合。
  • データ最適化からモデルデプロイまでのワークフローを簡素化。
サイト内本文

732バイトから無へ:Copy Failの本番環境でのシャットダウン

Together AIは、Linuxカーネルの脆弱性Copy Fail(CVE-2026-31431)への迅速な対応を詳述しています。この脆弱性は、ローカルの特権のないユーザーがAF_ALGインターフェースを介して正確な4バイト書き込みプリミティブを可能にし、権限昇格を引き起こします。チームは脆弱なカーネルモジュールをアンロードし、パッチを適用し、検出を強化することでAIインフラストラクチャの安全を確保しました。

  • Copy Fail(CVE-2026-31431)はLinuxカーネルの暗号サブシステムの論理バグで、読み取り可能なファイルのページキャッシュに4バイトの書き込みを可能にします。
  • Together AIはalgif_aeadモジュールをアンロードし、ファイルを数時間以内に削除して、再起動なしでエクスプロイトを阻止しました。
サイト内本文

DeepSeek-V4 Pro が Together AI で利用可能に

1.6兆パラメータのMoE推論モデルDeepSeek-V4 ProがTogether AIで利用可能になりました。512Kコンテキストウィンドウ、制御可能な推論モード、キャッシュ入力価格設定を備え、コードエージェント、ドキュメントインテリジェンス、研究合成などの長文脈推論ワークロードに最適です。

  • 1.6TパラメータMoE、アクティブパラメータ49B、Together AI上で512Kコンテキスト(モデルは1M対応)
  • 3つの推論モード:Non-Think、Think High、Think Maxでタスクの難易度に応じて推論の深さを選択可能
サイト内本文

全ソース