AI News HubLIVE
公開文章 37採集文章 40可信度 84刷新頻率 120 分鐘
健康狀態 健康來源類型 官方原文權限 官方原文最近入庫 2026-08-07ID fireworks-blog運行狀態 已啟用

Official AI inference and model platform blog; confirm reuse terms before full body display.

最新公開文章

待翻譯:Three Tests to Run Before You Switch from LoRA to FullFT

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Three Tests to Run Before You Switch from LoRA to FullFT Kimi K3 on Fireworks: Frontier Intelligence You Can Own Blog Three Tests To Run Before You Switch From Lora To Fullft Three Tests to Run Before You Switch from Lo…

  • AI 服務暫時不可用,系統已先保留來源內容與降級元數據。
  • Three Tests to Run Before You Switch from LoRA to FullFT Kimi K3 on Fireworks: Frontier Intelligence You Can Own Blog Three Tests To Run Before You Switch From Lora To Fullft Thre…
站內正文

Trilogy 利用 Kimi K3 實現開放權重網絡安全的策略手冊

Trilogy 人工智能卓越中心發佈了基於 Fireworks 平台 Kimi K3 的網絡安全策略手冊。該手冊強調開放權重模型在防禦型人工智能中的優勢,能夠支持連續、高容量的安全工作流程,無需依賴受限或昂貴的模型。手冊詳細介紹了實用參考堆棧:確定性工具負責結構化和事實提取,Kimi K3 負責判斷,並採用路徑為中心的審計方法。Fireworks 提供託管推理服務,使團隊可以獨立擴展,同時保留對審計工作流的控制。

  • Trilogy 的策略手冊利用 Fireworks 上的 Kimi K3 進行開放權重網絡安全,強調部署靈活性。
  • 手冊將確定性工具(索引、解析)與 AI 判斷(Kimi K3)分離,提高安全審計效率。
站內正文

Fireworks Nexus:即插即用的開放前沿智能,專為有預算限制的團隊打造

Fireworks AI 推出 Fireworks Nexus,幫助工程團隊在不改變工作流程的情況下,通過智能路由將日常任務分配給經濟高效的開源模型,從而顯著降低 AI 支出。初步測試顯示,它能將每合併 PR 的成本降低三分之一,混合 Token 費率約為封閉模型實驗室的四分之一。

  • Fireworks Nexus 提供企業級控制、成本可觀測性和工作流連續性,允許團隊集中管理 AI 使用。
  • FireConnect 一鍵安裝,使現有工具(如 Claude Code、Codex)無縫連接開源模型。
站內正文

Fireworks AI 推出 Kimi K3 的 LoRA 訓練:前沿智能,觸手可及

Fireworks AI 為其巨大的 MoE 模型 Kimi K3(約 2.8 萬億參數)推出了無服務器 LoRA 訓練。LoRA 適配器訓練成本低,服務靈活,可將細微調整成本降至幾乎為零。通過兩個任務示例(Countdown 和 Frozen Lake)展示了小適配器如何快速教模型新目標或工具使用循環。文章還強調了獎勵設計的重要性,以及數據飛輪效應。

  • Fireworks 推出 Kimi K3 的無服務器 LoRA 訓練,按 token 付費,無需管理 GPU 集羣。
  • LoRA 適配器僅幾 MB,可針對特定行為進行低成本微調,支持實時合併或多 LoRA 部署。
站內正文

Kimi K3 登錄 Fireworks:觸手可及的前沿智能

Kimi K3 是首個達到 2.8 萬億參數的開源模型,性能媲美甚至超越 Fable 5、Opus 5 和 GPT 5.5 等閉源模型。Fireworks 提供美國服務器託管、零數據保留的推理與訓練服務,用户可按需使用,無需管理 GPU 基礎設施。

  • Kimi K3 擁有 2.8T 參數,激活率僅 1.14%,在多項基準測試中領先。
  • 在編程、寫作、法律分析、客服和多模態任務上表現卓越。
站內正文

2026年最佳開源大語言模型:我們評測了7個模型

本文評測了截至2026年中期的9個開源大語言模型,從基準測試、上下文窗口、多模態支持和許可證等方面進行比較。文章指出Kimi K3性能領先,但權重尚未完全開放;GLM 5.2是目前在Fireworks上可用的最佳開源模型。DeepSeek-V4-Pro、MiniMax M3和gpt-oss-120b等模型針對特定用例進行評估。

  • Kimi K3在基準測試中領先,但完整權重預計2026年7月才發佈。
  • GLM 5.2是Fireworks上可用的最佳開源模型,擁有1,040k上下文窗口。
站內正文

Heidi x Fireworks:縮小前沿模型性能差距

Heidi Health與Fireworks AI合作,通過監督微調(SFT)和強化微調(RFT)技術,在臨牀試驗筆記數據集上超越了Gemini Pro等前沿模型。合作伙伴關係不僅將延遲從25秒降至7秒,還實現了3.5倍的性能提升。成功的關鍵在於高質量數據過濾和大批量訓練(有效批量大小達150萬token),有效消除了噪聲並提升了模型質量。

  • Heidi與Fireworks合作,從封閉模型轉向開放模型,獲得更高性能和成本節約。
  • 通過SFT和RFT,模型質量超越前沿模型,在內部評估中表現更優。
站內正文

Kimi K3 與 Fable 競爭;Kimi K3 + Fable 達到 SOTA

Fireworks AI 發佈新研究,開源模型 Kimi K3 與閉源模型 Fable 5 在約 1000 個智能體任務上對比,通過任務路由兩者結合可實現 93% 準確率,成本降低最高達 50 倍,表明最佳 AI 來自模型組合而非單一模型。

  • Kimi K3 和 Fable 5 在整體性能上接近,但在不同任務領域各有專長。
  • 通過神諭路由,K3 被選中處理 72-96% 的任務,組合性能超過任何單一模型。
站內正文

在NVIDIA Blackwell上優化MiniMax M3稀疏注意力

Fireworks AI團隊為MiniMax M3稀疏注意力開發了Blackwell(SM100)內核,採用KV-固定執行路徑,每個KV塊只加載一次,實現了約980 TFLOP/s的吞吐量和4.1 TB/s的HBM帶寬,相比查詢固定基線(FlashInfer)加速1.9–2.4倍,相比開源MSA內核加速約1.6倍。本文詳細介紹了算法、內核設計、優化及I/O成本模型。

  • 稀疏注意力通過減少計算和內存成本加速長上下文推理,但數據依賴的選擇導致不規則訪存,抵消理論加速。
  • Fireworks AI的KV-固定內核通過外循環加載選中的KV塊,內循環處理所有選擇該塊的查詢,實現高效計算。
站內正文

Fireworks完成15億美元D輪融資

Fireworks宣佈完成15.05億美元D輪融資,估值達175億美元,公司年經常性收入突破10億美元,每日處理超過40萬億個token,其中95%以上來自客户專有數據優化的模型。

  • Fireworks在D輪融資中籌集15.05億美元,估值175億美元。
  • 公司年化收入超過10億美元,每日處理40萬億token。
站內正文

Gumloop藉助Fireworks AI在3周內將開源模型使用量提升7倍

Gumloop通過與Fireworks AI合作,在三週內將開源模型代理對話量提升7倍,成本降低高達72%,同時保持輸出質量不變。

  • Gumloop將其內部代理從Opus 4.8遷移到GLM-5.2,用户未察覺到差異。
  • 實現了72%的成本節省,開源模型使用量增長7倍。
站內正文

開放、前沿、屬於你:LangChain Deep Agents 在 NVIDIA Nemotron 3 Ultra 上運行於 Fireworks

LangChain 為 NVIDIA Nemotron 3 Ultra 調優了 Deep Agents 框架,實現了開源模型中領先的智能體性能,成本僅為閉源替代方案的十分之一。該模型在 Fireworks 上運行,支持後訓練定製,幫助企業構建專屬智能。

  • LangChain Deep Agents 在 Nemotron 3 Ultra 上表現卓越,成本降低 10 倍。
  • Fireworks 提供優化推理棧,支持模型後訓練和部署。
站內正文

如何用 GLM 5.2 Fast 在四天內完成一個月的工程工作量

作者使用 FireConnect 上的 GLM 5.2 Fast 模型,在 Claude Code 的輔助下,僅用四天時間和 218 美元的推理成本,完成了一項通常需要一個月才能完成的 GPU 調度器回收功能。文章詳細介紹了問題背景、工作流程(設計、規劃、實現)以及成功的關鍵因素:快速推理消除了上下文切換成本,低成本消除了對 token 使用的顧慮,模型質量保證了複雜邏輯的正確性。

  • 通過 FireConnect 在 Claude Code 上使用 GLM 5.2 Fast,在四天內完成了 GPU 調度器的回收功能。
  • 項目產出包括 4 個 PR、約 3000 行代碼、16 個單元測試和 18 個集成測試,全部通過。
站內正文

GLM 5.2 Fast 現已在 Fireworks 上線

GLM 5.2 Fast 在 Fireworks 平台上線,提供 Opus 級別的智能和開源價格,無需合同,按 token 付費。該模型專為智能體循環優化,支持 1M token 上下文窗口,快速推理速度達 446 tok/sec,並具有主動提示緩存和結構化輸出支持。Fireworks 通過優化 MoE 和稀疏注意力架構實現了高性能,同時保持質量不變。

  • GLM 5.2 Fast 運行速度比標準路徑快 2-3 倍,支持 1M token 上下文窗口和主動提示緩存。
  • Fireworks 優化了模型的 MoE 和稀疏注意力架構,實現了獨立的分片策略。
站內正文

Factory 如何在六個月內通過 Fireworks 將開源模型使用量提升 2-3 倍

Factory 是一家構建智能體原生軟件開發的公司,其 Droid 智能體覆蓋整個軟件開發生命週期。通過採用 Fireworks 的開源模型推理平台,Factory 在六個月內將開源模型使用量提升了 2-3 倍,同時將任務成本降至前沿模型的 6%-20%,吞吐量提升了 5-15 倍。這得益於 Fireworks 提供的模型全覆蓋、零日可用、高可靠性和低延遲。

  • Factory 通過 Fireworks 平台實現對所有開源模型的零日訪問,大幅提升模型使用量。
  • 開源模型成本僅為前沿模型的 6%-20%,同時保持高質量,使自動化更具經濟性。
站內正文

Cursor Composer 2 + Fireworks AI

Cursor 發佈了 Composer 2,這是一款為 Cursor 開發環境優化的編碼模型。它基於 Kimi 2.5,結合持續預訓練和大規模強化學習,實現了前沿的編碼性能,同時推理成本降低 6-10 倍。Fireworks AI 提供分佈式推理基礎設施,使強化學習規模化成為可能。

  • Composer 2 是 Cursor 為其開發環境量身定製的編碼模型,通過持續預訓練和強化學習提升性能。
  • 該模型在 CursorBench、Terminal-Bench 和 SWE-bench Multilingual 上取得領先分數。
站內正文

低成本前沿AI:開源工作者與閉源顧問的組合方案

本文介紹了一種開源工作者(如Kimi-K2.6或GLM-5.2)與閉源前沿顧問(Claude Opus 4.8)相結合的AI代理架構。該方案在SWE-bench Pro、Terminal-Bench 2.1和Legal Agent Bench三個基準測試中均實現了穩定性能提升,同時將推理成本降低19%至67%。GLM-5.2搭配顧問在Terminal-Bench上達到與Opus相當的水平(約80%),在Legal Agent Bench上甚至超越Opus,成本卻低40%。

  • 開源工作者(Kimi-K2.6或GLM-5.2)端到端驅動任務,在最終階段諮詢閉源前沿模型(Claude Opus 4.8)一次。
  • SWE-bench Pro提升4至7個百分點,Terminal-Bench 2.1提升4至8個百分點,Legal Agent Bench提升1至4個百分點。
站內正文

Fireworks AI

Fireworks AI 宣佈自2026年7月1日起,所有自助服務賬户將遷移至預付費計費模式。用户可立即切換或等待自動遷移,預付費模式通過預先購買信用額度實現費用可預測,自動充值功能可避免服務中斷。簽約客户不受影響。

  • Fireworks AI 將於2026年7月1日起將自助服務賬户遷移至預付費計費。
  • 用户可選擇立即切換或等待自動遷移。
站內正文

GLM 5.2 在 Fireworks 推理平台上線,零日可用

智譜(Z.ai)發佈的最新開源模型 GLM 5.2 現已通過 Fireworks 推理平台提供。該模型在編程基準測試中表現領先,擁有100萬token的上下文窗口,適用於長週期代理任務,並採用MIT許可證。Fireworks 獨立驗證了模型性能,並強調其基礎設施優勢而非路由。

  • GLM 5.2 零日上線 Fireworks 推理平台,由智譜(Z.ai)發佈,該模型專為長週期編程任務設計。
  • 擁有100萬token的上下文窗口,在 GPQA-Diamond 基準測試中得分91.4%,經 Fireworks 獨立驗證。
站內正文

Fireworks 上的 Kimi K2.7 Code:更優的代理,更低的單任務成本,上線首日可用

月之暗面(Moonshot AI)發佈 Kimi K2.7 Code,這是 K2 系列的最新編程模型,現已通過 Fireworks AI 提供 Day-0 支持。相比 K2.6,該模型推理 token 減少約 30%,同時在編程評測中得分更高。推理 token 的減少顯著降低了代理工作流的單任務成本。Fireworks 提供標準、優先和快速(即將推出)三種服務層級,滿足不同可靠性和速度需求。

  • Kimi K2.7 Code 比 K2.6 少用約 30% 的推理 token,但在編程評測中表現更優。
  • 減少推理 token 通過複合效應降低了代理工作流的整體任務成本。
站內正文

Qwen 3.7 Plus 現已在 Fireworks 上線

阿里巴巴與 Fireworks 合作,在 Fireworks 基礎設施上獨家託管 Qwen 3.7 Plus 模型。該模型專為智能體循環設計,支持思考與非思考模式,上下文窗口達 262K token,並在多項基準測試中表現優異。Fireworks 作為推理提供商,提供高性能、低延遲的推理服務,數據零保留,SLA 達 99.9%。定價較前代便宜約 50%。

  • Qwen 3.7 Plus 是阿里巴巴的旗艦多模態模型,現通過 Fireworks 的 Serverless API 提供服務。
  • 模型專為智能體工作負載優化,支持思維鏈保留和多模態輸入。
站內正文

MiniMax M3 正式上線:長上下文 + 原生多模態,價格僅為 1/20

MiniMax 發佈旗艦模型 M3,具備超 50 萬 token 上下文窗口、原生多模態能力(文本、圖像、視頻),並採用創新的 MiniMax 稀疏注意力(MSA)架構,大幅提升推理效率。在 Fireworks 平台上,M3 價格僅為 M2.7 的 1/20,旨在為開源社區提供前沿水平的編碼和智能體能力。

  • MiniMax M3 支持超過 500K token 的上下文窗口,未來將擴展到 1M token。
  • 採用 MiniMax 稀疏注意力(MSA)架構,計算效率提升 4 倍以上。
站內正文

NVIDIA Nemotron 3 Ultra 在 Fireworks 上線,零日支持

NVIDIA 發佈 Nemotron 3 Ultra 開源模型,專為長時自主代理任務優化,擁有 550B 總參數、混合 Transformer-Mamba MoE 架構,可在 Fireworks 平台零日部署。該模型在代理任務上推理速度提升 5 倍,成本降低 30%,支持從訓練到生產的一體化流程。

  • Nemotron 3 Ultra 是專為長運行自主代理設計的開源模型,總參數 550B,活躍參數 55B。
  • 採用混合 Transformer-Mamba MoE 架構,支持高達 1M 上下文。
站內正文

開源代理與前沿顧問:通過訓練和引擎工程匹配前沿性能

Fireworks AI 和 Harvey 在 Legal Agent Benchmark (LAB) 上探索了兩種系統級技術,以降低對單一前沿模型的依賴,同時以更低成本實現前沿級性能。混合引擎使用開源 GLM 5.1 工作器和 Claude Opus 4.7 顧問,在 100 個任務上以 368 美元成本實現 18/100 的全通過率,超過了僅使用 Opus 的 14/100(成本 954 美元)。對 Kimi K2.6 進行監督微調 (SFT) 和強化微調 (RFT) 後,全通過率以 84 美元成本達到 15/100,平均分從 0.863 提升至 0.886。

  • 混合引擎使用開源工作器和前沿顧問作為可調用工具,以低於端到端前沿模型的成本實現更高的全通過率。
  • Fireworks 上的後訓練:SFT 將全通過率從 11/100 提升至 15/100;RFT 將平均分從 0.863 提高至 0.886。
站內正文

Trilogy 藉助 Fireworks AI 驗證開源權重模型在企業工作負載中的表現

Trilogy 的 AI 卓越中心評估了 Fireworks AI 作為推理基礎設施,以標準化開源權重模型的使用,降低了成本並實現了十億級 token 的代理工作流。

  • Trilogy 採用 Fireworks AI 作為企業級開源權重模型的推理層。
  • 成本降至專有系統的約五分之一,避免了速率限制問題。
站內正文

智能體執行税:大模型在瀏覽器自動化中的真正瓶頸

在720次瀏覽器代理任務基準測試中發現,模型在結構化輸出可靠性上的差異導致高達22.9%的執行税(浪費的推理調用佔比)。Kimi K2.5實現零執行税,而Gemini 2.5 Flash在近五分之一的調用中出現JSON格式錯誤。這種執行開銷不僅增加了成本,還放大了延遲和任務失敗風險。

  • 智能體執行税衡量因無效結構化輸出而產生的冗餘推理調用比例,Gemini高達22.9%,而Kimi為零。
  • 結構化輸出可靠性是核心瓶頸:Gemini每5次調用就有1次解析失敗,導致87%的任務至少經歷一次重試。
站內正文

Serverless 2.0:三種推理運行方式,一個API

Fireworks AI推出Serverless 2.0,在無需預留容量的情況下,通過一個API提供標準、優先和快速三種推理服務路徑。標準路徑是默認的彈性共享基礎設施,優先路徑在高負載下提供更強的准入保障,快速路徑則實現約兩倍的生成令牌吞吐量。同時,該版本將負載丟棄和速率限制錯誤碼分離,明確區分429和503狀態碼,幫助開發者編寫正確的重試邏輯和警報配置。

  • Serverless 2.0 提供三種服務意圖:標準(默認)、優先(高負載下優先准入)和快速(高吞吐量)。
  • 優先路徑在峯值負載測試中實現了0%的503錯誤率,而標準路徑為0.082%。
站內正文

創新解決方案藉助 Fireworks AI 重構企業服務交付

作為 AWS 頂級合作伙伴,創新解決方案公司通過將推理層遷移至 Fireworks AI,實現了服務交付的變革。其 DarcyIQ 平台從內部效率工具發展為多智能體執行系統,合同週期從 30-45 天縮短至約 3 天,交付吞吐量翻倍,推理成本從線性增長轉變為可預測的單位經濟學。

  • 創新解決方案公司將推理層從 Anthropic 遷移至 Fireworks AI,降低了模型集成開銷,實現了穩定且成本可控的推理。
  • DarcyIQ 平台進化為多智能體執行系統,覆蓋銷售、範圍界定和交付全生命週期,合同週期縮短至約 3 天。
站內正文

Fireworks AI 收購 Hathora 以加速全球計算編排

Fireworks AI 宣佈收購專為低延遲實時工作負載打造全球容器編排平台的公司 Hathora。此次收購旨在將 Hathora 在遊戲領域積累的毫秒級延遲優化技術應用於 AI 推理,以提升全球推理速度和可靠性。

  • Fireworks AI 收購 Hathora,整合其容器編排技術。
  • Hathora 專注於毫秒級延遲優化,應用於 AI 推理。
站內正文

Fireworks AI 登陸 Microsoft Foundry,為 Azure 帶來頂級開源模型推理服務

Fireworks AI 宣佈在 Microsoft Foundry 上推出公開預覽版,將其高性能開源模型推理服務集成到 Azure 平台。該合作使開發者能夠通過統一的 Foundry 平台訪問 DeepSeek V3.2、Kimi K2.5 等領先開源模型,並支持自帶權重、按需擴展及企業級治理。

  • Fireworks AI 在 Microsoft Foundry 上提供公開預覽版,將高性能開源模型推理引入 Azure。
  • 首批模型包括 DeepSeek V3.2、Kimi K2.5、MiniMax M2.5 等,支持自帶權重和靈活定價。
站內正文

全部來源