AI News HubLIVE
公開記事 37収集記事 40信頼度 84更新頻度 120 分
稼働状態 正常ソース種別 公式全文利用権限 公式全文最終取り込み 2026-08-07ID fireworks-blog状態 有効

Official AI inference and model platform blog; confirm reuse terms before full body display.

最新公開記事

翻訳待ち:Three Tests to Run Before You Switch from LoRA to FullFT

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Three Tests to Run Before You Switch from LoRA to FullFT Kimi K3 on Fireworks: Frontier Intelligence You Can Own Blog Three Tests To Run Before You Switch From Lora To Fullft Three Tests to Run Before You Switch from Lo…

  • AI 生成が一時的に利用できないため、ソース内容とフォールバックメタデータを保存しました。
  • Three Tests to Run Before You Switch from LoRA to FullFT Kimi K3 on Fireworks: Frontier Intelligence You Can Own Blog Three Tests To Run Before You Switch From Lora To Fullft Thre…
サイト内本文

Trilogy の Kimi K3 を活用したオープンウェイトサイバーセキュリティプレイブック

Trilogy AI Center of Excellence は、Fireworks 上の Kimi K3 をベースにしたサイバーセキュリティプレイブックを公開しました。このプレイブックは、防御型 AI におけるオープンウェイトモデルの利点を強調し、制限された高価なモデルに依存することなく、継続的な高負荷セキュリティワークフローを可能にします。具体的なリファレンススタックとして、決定論的ツールによる構造化と Kimi K3 による判断を分離し、パス中心の監査アプローチを採用しています。Fireworks はマネージド推論を提供し、チームは監査ワークフローの制御を維持しながら独立してスケーリングできます。

  • Trilogy のプレイブックは Fireworks 上の Kimi K3 を利用したオープンウェイトサイバーセキュリティであり、展開の柔軟性を重視。
  • プレイブックは決定論的ツール(インデックス、パース)と AI 判断(Kimi K3)を分離し、効率的なセキュリティ監査を実現。
サイト内本文

Fireworks Nexus:予算制限のあるチーム向けのドロップイン型オープンフロンティアインテリジェンス

Fireworks AI は Fireworks Nexus を発表。エンジニアリングチームがワークフローを変更せずに、ルーティンタスクをコスト効率の良いオープンソースモデルにルーティングすることで AI コストを削減できる。初期テストでは、マージ PR あたりのコストが 3 分の 1 削減され、ブレンドトークンレートはクローズドモデルラボの約 4 分の 1 となっている。

  • Fireworks Nexus はエンタープライズコントロール、コスト可観測性、ワークフローの継続性を提供し、チーム全体の AI 利用を一元管理できる。
  • FireConnect はワンラインインストールで、Claude Code や Codex などの既存ツールをオープンモデルにシームレスに接続する。
サイト内本文

Fireworks AI、Kimi K3向けLoRAトレーニングを発表:最前線の知能を手軽に

Fireworks AIは、約2.8兆パラメータのMoEモデル「Kimi K3」向けにサーバーレスLoRAトレーニングを開始しました。LoRAアダプターは低コストで微調整が可能で、トークン単位の料金と柔軟な提供方法を特徴とします。2つのタスク例を通じて、小さなアダプターが数分で新しい目標やツール使用ループを学習する様子を示しています。報酬設計の重要性とデータフライホイール効果も強調されています。

  • Kimi K3のサーバーレスLoRAトレーニングが利用可能に。トークン単位課金で、クラスタ管理不要。
  • LoRAアダプターは数MBで、特定の振る舞いを低コストで微調整。ライブマージやマルチLoRA展開が可能。
サイト内本文

Fireworks 上の Kimi K3:手に入るフロンティアインテリジェンス

Kimi K3 は、2.8 兆パラメータを誇る初のオープンウェイトモデルで、Fable 5、Opus 5、GPT 5.5 などのクローズドモデルに匹敵する性能を発揮します。Fireworks では、米国ホスティングによる推論とトレーニングを提供し、データ保持ゼロ、GPU 管理不要で利用可能です。

  • Kimi K3 は 2.8T パラメータを持ち、フロントエンドコードで世界一位、多くのベンチマークでトップクラス。
  • Kimi Delta Attention と MoE アーキテクチャにより、低コストで高い効率を実現。
サイト内本文

2026年最高のオープンソースLLM:7モデルを徹底レビュー

2026年半ば時点で9つのオープンソースLLMをレビューし、ベンチマーク、コンテキストウィンドウ、マルチモーダル対応、ライセンスなどを比較。Kimi K3がトップだが、重みの公開は未定。Fireworksで利用可能な最高のオープンモデルはGLM 5.2。DeepSeek-V4-Pro、MiniMax M3、gpt-oss-120bなどが特定のユースケースで推奨される。

  • Kimi K3はベンチマークでトップだが、重みの公開は2026年7月予定。
  • GLM 5.2はFireworksで利用可能な最高のオープンモデルで、1,040kトークンのコンテキストウィンドウを持つ。
サイト内本文

Heidi x Fireworks:最先端モデルの性能ギャップを埋める

Heidi HealthはFireworks AIと提携し、監視付き微調整(SFT)と強化学習微調整(RFT)を用いて、臨床ノートデータセットにおいてGemini Proなどの最先端モデルを凌駕する品質を達成しました。パートナーシップによりレイテンシを25秒から7秒に短縮し、3.5倍の性能向上を実現。成功の鍵は、高品質なデータフィルタリングと大規模バッチトレーニング(実効バッチサイズ150万トークン)にありました。

  • Heidiはクローズドモデルからオープンモデルに移行するためFireworksと提携し、高い性能とコスト削減を実現。
  • SFTとRFTにより、内部評価でGemini Proクラスのモデルを上回る品質を達成。
サイト内本文

Kimi K3 は Fable と競合し、Kimi K3 + Fable が SOTA に

Fireworks AI の新たな研究により、オープンソースモデル Kimi K3 がクローズドソースの Fable 5 と約 1,000 のエージェントタスクで競合し、ルーティングにより 93% の精度と最大 50 倍のコスト削減を達成。最高の AI は単一モデルではなくモデルの混合から生まれる。

  • Kimi K3 と Fable 5 は全体的に同等だが、タスク領域ごとに異なる強みを持つ。
  • オラクルルーティングにより K3 が 72〜96% のタスクに選択され、単一モデルを上回る性能。
サイト内本文

NVIDIA BlackwellでのMiniMax M3スパースアテンションの最適化

Fireworks AIチームは、MiniMax M3スパースアテンション向けにBlackwell(SM100)カーネルを開発しました。KV固定実行パスを採用し、各KVブロックを1回だけロードすることで、約980 TFLOP/sのスループットと約4.1 TB/sのHBM帯域幅を達成し、クエリ固定ベースライン(FlashInfer)比1.9–2.4倍、オープンソースMSAカーネル比約1.6倍の高速化を実現しました。本記事では、アルゴリズム、カーネル設計、最適化、I/Oコストモデルについて詳述します。

  • スパースアテンションは長コンテキスト推論の計算・メモリコストを削減するが、データ依存の選択により不規則なメモリアクセスが発生し、理論上の高速化が打ち消される。
  • Fireworks AIのKV固定カーネルは、外側ループで選択されたKVブロックを1回ロードし、内側ループでそれを選択した全クエリを処理するため、効率的な計算が可能。
サイト内本文

Fireworksが15億ドルのシリーズD資金調達を完了

Fireworksは15.05億ドルのシリーズDラウンドを発表し、評価額は175億ドルに。年商10億ドル超、1日あたり40兆トークンを処理し、その95%以上が顧客専有データに特化したモデルからのもの。

  • FireworksがシリーズDで15.05億ドルを調達、評価額175億ドル。
  • 年間経常収益が10億ドルを突破、1日40兆トークンを処理。
サイト内本文

Gumloop、Fireworks AIでオープンウェイトモデルの使用量を3週間で7倍に拡大

GumloopはFireworks AIとの提携により、3週間でオープンウェイトモデルのエージェントチャットを7倍に増加させ、品質を維持しながら最大72%のコスト削減を実現しました。

  • Gumloopは内部エージェントをOpus 4.8からGLM-5.2に移行し、ユーザーに認識される違いはなかった。
  • 72%のコスト削減とオープンウェイトモデルの使用量7倍増を達成。
サイト内本文

オープン、フロンティア、そしてあなたのもの:Fireworks 上で動作する NVIDIA Nemotron 3 Ultra 向け LangChain Deep Agents

LangChain は NVIDIA Nemotron 3 Ultra 向けに Deep Agents ハーネスをチューニングし、オープンモデルの中でベンチマークをリードするエージェント性能を実現、コストはクローズドな代替品の10分の1です。チューニングされたハーネスは LangChain Deep Agents に含まれ、Nemotron 3 Ultra は Fireworks 上で初日からサポートされます。

  • LangChain Deep Agents on Nemotron 3 Ultra は、タスクあたりのコストを10分の1に抑えつつ、フロンティア性能を達成。
  • Fireworks はポストトレーニングによるカスタマイズを可能にし、企業はモデルを所有し改善できる。
サイト内本文

GLM 5.2 Fast で1か月分のエンジニアリング作業を4日間でリリースした方法

著者は、FireConnect 経由で Claude Code 上で GLM 5.2 Fast を使用し、通常1か月相当の GPU スケジューラのリクレーム機能を、わずか4日間と218ドルの推論コストで実装しました。記事では、高速推論によるコンテキストスイッチの排除、低コストによるトークン使用の制限からの解放、複雑な並行処理ロジックを扱えるモデルの品質について詳述しています。

  • FireConnect 経由で Claude Code 上で GLM 5.2 Fast を使用し、GPU スケジューラのリクレーム機能を4日間で実装。4つのPR、約3000行のコード、34のテストを全てパスし、推論コストは218ドル。
  • 高速推論(毎秒約400トークン)によりリアルタイムな設計コラボレーションが可能になり、設計フェーズが数週間から1日に短縮。
サイト内本文

GLM 5.2 Fast が Fireworks で利用可能に

GLM 5.2 Fast が Fireworks でリリースされ、Opus レベルの知能をオープンソース価格で提供します。契約不要でトークン単位の課金です。1M トークンのコンテキストウィンドウ、積極的なプロンプトキャッシュ、構造化出力をサポートし、共有サーバーレスで標準パスの2〜3倍の速度を実現します。Fireworks は 446 tok/sec を達成し、MoE とスパースアテンションのアーキテクチャを最適化しました。

  • GLM 5.2 Fast は標準より2〜3倍高速で、1M トークンコンテキストとプロンプトキャッシュ(100万キャッシュ入力トークンあたり$0.14)を提供。
  • Fireworks は MoE とスパースアテンションを別々に最適化し、並列性とメモリ効率を向上。
サイト内本文

Factory が Fireworks でオープンモデルの使用量を6ヶ月で2~3倍に増やす方法

Factory はエージェントネイティブなソフトウェア開発を構築しており、その Droid エージェントはソフトウェア開発ライフサイクル全体をカバーします。Fireworks のオープンウェイトモデル推論プラットフォームを採用することで、Factory は6ヶ月でオープンモデルの使用量を2~3倍に増やし、タスクコストをフロンティアモデルの6%~20%に削減し、スループットを1ドルあたり5~15倍向上させました。これは、Fireworks の完全なモデルカバレッジ、デイゼロ利用可能性、高い信頼性、低レイテンシーによるものです。

  • Factory は Fireworks を介してすべてのオープンモデルにデイゼロアクセスを実現し、使用量を2~3倍に増やしました。
  • オープンモデルのコストはフロンティアモデルの6%~20%でありながら品質を維持し、自動化を経済的にします。
サイト内本文

Cursor Composer 2 + Fireworks AI

Cursorは、Cursor開発環境に最適化されたコードモデルComposer 2をリリースしました。Kimi 2.5をベースに、継続的プレトレーニングと大規模強化学習を組み合わせ、最先端のコーディング性能を実現しつつ、推論コストを6〜10倍削減します。Fireworks AIは分散型推論インフラを提供し、RLのスケーラビリティを可能にします。

  • Composer 2はCursor環境向けに特化したコードモデルで、継続的プレトレーニングと強化学習で性能を向上。
  • CursorBench、Terminal-Bench、SWE-bench Multilingualで最高スコアを達成。
サイト内本文

低コストで最前線のAI:オープンソースワーカーとクローズドソースアドバイザーの組み合わせ

本記事では、オープンソースのワーカーエージェント(Kimi-K2.6またはGLM-5.2)とクローズドソースの最前線モデル(Claude Opus 4.8)を組み合わせたアーキテクチャを紹介。SWE-bench Pro、Terminal-Bench 2.1、Legal Agent Benchの3つのベンチマークで一貫した性能向上を達成し、推論コストを19%から67%削減する。GLM-5.2とアドバイザーの組み合わせはTerminal-BenchでOpusと同等(約80%)でありながらコストは約47%低く、Legal Agent BenchではOpusを上回りコストは40%低い。

  • オープンソースワーカー(Kimi-K2.6またはGLM-5.2)がタスクをエンドツーエンドで実行し、最終段階でクローズドソースの最前線モデル(Claude Opus 4.8)に1回だけ相談する。
  • SWE-bench Proで4~7ポイント、Terminal-Bench 2.1で4~8ポイント、Legal Agent Benchで1~4ポイントの改善。
サイト内本文

Fireworks AI

Fireworks AIは2026年7月1日より、すべてのセルフサービスアカウントをプリペイド課金に移行します。ユーザーは今すぐ切り替えるか、自動移行を待つかを選択できます。プリペイド課金はクレジットの事前購入により予算の予測可能性を高め、自動リロード機能でサービス中断を防止します。契約顧客は影響を受けません。

  • Fireworks AIは2026年7月1日よりセルフサービスアカウントをプリペイド課金に移行します。
  • ユーザーは今すぐ切り替えるか、自動移行を待つかの選択が可能です。
サイト内本文

GLM 5.2 が Fireworks 推論でデイゼロ提供開始

Z.ai(旧称 Zhipu)の最新オープンソースモデル GLM 5.2 が、Fireworks 推論プラットフォームで利用可能になりました。コーディングベンチマークでリードし、100万トークンのコンテキストウィンドウを備え、MITライセンスで提供されます。Fireworks は独立して性能を検証し、ルーティングではなくインフラストラクチャを重視しています。

  • GLM 5.2 が Fireworks 推論でデイゼロ提供開始。
  • コーディングで最強のオープンソースモデル、100万トークンコンテキスト。
サイト内本文

Fireworks 上の Kimi K2.7 Code:より優れたエージェント、タスクあたりの低コスト、初日利用可能

Moonshot AI は、K2 シリーズの最新コーディングモデル「Kimi K2.7 Code」をリリースし、Fireworks AI で初日からサポートを開始しました。このモデルは前世代の K2.6 と比べて推論トークンを 30% 削減しながら、コーディングベンチマークで高いスコアを達成しています。推論トークンの削減により、エージェントワークフローでのタスク完了コストが大幅に低減されます。Fireworks は Standard、Priority、Fast(近日公開)の 3 つのサービスオプションを提供し、信頼性と速度のニーズに応えます。

  • Kimi K2.7 Code は K2.6 より 30% 少ない推論トークンで、コーディング評価で高スコア。
  • 推論トークンの削減は、複合効果によりエージェントタスクの総コストを低減。
サイト内本文

Qwen 3.7 Plus が Fireworks で利用可能に

Alibaba は Fireworks と提携し、Qwen 3.7 Plus を Fireworks のインフラ上でホスティング、サーバーレス API として提供開始。エージェントループ向けに設計され、思考モードと非思考モードをサポート、コンテキストウィンドウは 262K トークン。前世代比約 50% の価格低下。Fireworks はデータ保持ゼロポリシーと 99.9% のアップタイム SLA を提供。

  • Qwen 3.7 Plus は Fireworks のサーバーレス API で独占利用可能に。
  • エージェントワークロード向けに最適化され、画像入力と思考連鎖の保持に対応。
サイト内本文

MiniMax M3 が正式リリース:長文脈+ネイティブマルチモーダル、価格は1/20

MiniMax がフラッグシップモデル M3 を公開。50万トークン超のコンテキストウィンドウ、テキスト・画像・動画を理解するネイティブマルチモーダル、そして革新的な MiniMax Sparse Attention(MSA)アーキテクチャを搭載。Fireworks 上で M2.7 の1/20の価格で利用でき、オープンウェイトモデルに新たな基準を打ち立てた。

  • M3 は50万トークン超のコンテキストに対応し、近日中に100万トークンに拡大予定。
  • MiniMax Sparse Attention(MSA)技術により、計算効率が従来比4倍以上向上。
サイト内本文

NVIDIA Nemotron 3 Ultra が Fireworks でデイゼロサポート付きで公開

NVIDIA が公開した Nemotron 3 Ultra は、長時間実行される自律エージェント向けに最適化されたオープンモデルです。総パラメータ550B、ハイブリッド Transformer-Mamba MoE アーキテクチャを採用し、Fireworks 上でデイゼロサポートを提供。エージェントタスクにおいて、他のオープンモデルと比較して推論速度が5倍、コストが30%削減されます。

  • Nemotron 3 Ultra は自律エージェント向けのオープンモデルで、総パラメータ550B、アクティブパラメータ55B。
  • ハイブリッド Transformer-Mamba MoE アーキテクチャを採用し、最大1Mのコンテキストをサポート。
サイト内本文

オープンソースエージェントとフロンティアアドバイザー:トレーニングとハーネスエンジニアリングによるフロンティア性能の達成

Fireworks AIとHarveyは、Legal Agent Benchmark (LAB)において、単一のフロンティアモデルの呼び出しへの依存を減らしつつ、低コストでフロンティアレベルの性能を達成するための2つのシステムレベルの技術を探求しました。オープンソースのGLM 5.1ワーカーとClaude Opus 4.7アドバイザーによるハイブリッドハーネスは、100タスクで18/100のオールパスを368ドルで達成し、Opus単独(14/100、954ドル)を上回りました。Kimi K2.6へのSFTおよびRFTによるポストトレーニングでは、オールパスが15/100(84ドル)に向上し、平均スコアも改善されました。

  • オープンソースワーカーとフロンティアアドバイザーを呼び出し可能なツールとして使用するハイブリッドハーネスは、エンドツーエンドのフロンティアモデルよりも低コストで高いオールパスを達成します。
  • Fireworksでのポストトレーニング:SFTによりオールパスが11/100から15/100に向上。RFTにより平均スコアが0.863から0.886に向上。
サイト内本文

Trilogy、Fireworks AIによるオープンウェイトAIモデルのエンタープライズワークロード検証を実施

TrilogyのAI Center of Excellenceは、Fireworks AIを推論インフラとして評価し、オープンウェイトモデルの使用を標準化、コストを削減し、数十億トークンスケールのエージェンティックワークフローを実現しました。

  • TrilogyはFireworks AIをエンタープライズ向けオープンウェイトモデルの推論レイヤーとして採用。
  • コストを専有システムの約5分の1に削減し、レート制限の問題を解消。
サイト内本文

エージェント実行税:ブラウザ自動化における真のボトルネック

720回のブラウザエージェントタスクのベンチマークで、構造化出力の信頼性がエージェントAIのボトルネックであることが判明。Gemini 2.5 Flashは22.9%の実行税(無駄な推論呼び出しの割合)が発生したのに対し、Kimi K2.5はゼロ。この税はレイテンシ、コスト、失敗率を増幅させる。本レポートは信頼性調整済み精度とタスクあたりのコスト指標を導入する。

  • エージェント実行税は構造化出力の失敗による無駄な推論を測定し、最悪モデルで22.9%、最良で0%。
  • Gemini 2.5 Flashはタスクの86.7%で少なくとも1回のパース再試行が発生、Kimi K2.5は0%。
サイト内本文

Serverless 2.0:3つの推論実行方法、1つのAPI

Fireworks AIはServerless 2.0を発表し、予約容量なしでStandard、Priority、Fastの3つの推論パスを1つのAPIで提供します。Priorityパスは混雑時により強いリクエスト許可を提供し、Fastパスは約2倍のスループットを実現。また、負荷制限(503)とレート制限(429)を明確に分離し、リトライロジックとアラートを改善します。

  • Serverless 2.0は3つのサービスインテントを提供:Standard(デフォルト)、Priority(負荷時優先許可)、Fast(高スループット)。
  • Priorityはピーク負荷テストで0%の503エラーレートを達成、Standardは0.082%。
サイト内本文

Innovative Solutions、Fireworks AI でエンタープライズサービスの提供を再構築

AWS プレミア パートナーである Innovative Solutions は、推論レイヤーを Fireworks AI に移行することでサービス提供を変革しました。DarcyIQ プラットフォームは社内生産性ツールからマルチエージェント実行システムへと進化し、契約サイクルを 30~45 日から約 3 日に短縮、提供スループットを倍増させ、推論コストを予測可能かつ制御可能にしました。

  • Innovative Solutions は推論レイヤーを Anthropic から Fireworks AI に移行し、モデル統合のオーバーヘッドを削減し、安定した予測可能な推論を実現。
  • DarcyIQ はセールス、スコーピング、デリバリーをカバーするマルチエージェント実行システムへと進化し、契約サイクルを約 3 日に短縮。
サイト内本文

Fireworks AI、Hathoraを買収しグローバルコンピュートオーケストレーションを加速

Fireworks AIは、ゲーム向け低遅延コンテナオーケストレーションに特化したHathoraを買収しました。そのリアルタイム・マルチリージョン最適化技術をAI推論に適用し、推論速度と信頼性の向上を目指します。

  • Fireworks AIがHathoraを買収し、そのコンテナオーケストレーション技術を統合。
  • Hathoraはミリ秒単位のレイテンシ最適化に注力、AI推論に応用。
サイト内本文

Fireworks AI が Microsoft Foundry に対応、Azure で最高クラスのオープンモデル推論を提供

Fireworks AI は Microsoft Foundry 上でのパブリックプレビューを発表し、高性能なオープンモデル推論を Azure に統合します。DeepSeek V3.2、Kimi K2.5 などの最先端モデルをワンストップで利用可能にし、BYOW と柔軟な価格設定をサポートします。

  • Fireworks AI が Microsoft Foundry 上でパブリックプレビューを開始、Azure に高速オープンモデル推論をもたらす。
  • DeepSeek V3.2、Kimi K2.5、MiniMax M2.5 などのモデルが利用可能で、BYOW に対応。
サイト内本文

全ソース