待翻譯:Three Tests to Run Before You Switch from LoRA to FullFT 2026-08-08 00:26 UTC+8 AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Three Tests to Run Before You Switch from LoRA to FullFT Kimi K3 on Fireworks: Frontier Intelligence You Can Own Blog Three Tests To Run Before You Switch From Lora To Fullft Three Tests to Run Before You Switch from Lo…
AI 服務暫時不可用,系統已先保留來源內容與降級後設資料。 Three Tests to Run Before You Switch from LoRA to FullFT Kimi K3 on Fireworks: Frontier Intelligence You Can Own Blog Three Tests To Run Before You Switch From Lora To Fullft Thre… Trilogy 利用 Kimi K3 實現開放權重網路安全的策略手冊 2026-07-29 09:55 UTC+8 Trilogy 人工智慧卓越中心釋出了基於 Fireworks 平臺 Kimi K3 的網路安全策略手冊。該手冊強調開放權重模型在防禦型人工智慧中的優勢,能夠支援連續、高容量的安全工作流程,無需依賴受限或昂貴的模型。手冊詳細介紹了實用參考堆疊:確定性工具負責結構化和事實提取,Kimi K3 負責判斷,並採用路徑為中心的審計方法。Fireworks 提供託管推理服務,使團隊可以獨立擴充套件,同時保留對審計工作流的控制。
Trilogy 的策略手冊利用 Fireworks 上的 Kimi K3 進行開放權重網路安全,強調部署靈活性。 手冊將確定性工具(索引、解析)與 AI 判斷(Kimi K3)分離,提高安全審計效率。 Fireworks Nexus:即插即用的開放前沿智慧,專為有預算限制的團隊打造 2026-07-28 01:51 UTC+8 Fireworks AI 推出 Fireworks Nexus,幫助工程團隊在不改變工作流程的情況下,透過智慧路由將日常任務分配給經濟高效的開源模型,從而顯著降低 AI 支出。初步測試顯示,它能將每合併 PR 的成本降低三分之一,混合 Token 費率約為封閉模型實驗室的四分之一。
Fireworks Nexus 提供企業級控制、成本可觀測性和工作流連續性,允許團隊集中管理 AI 使用。 FireConnect 一鍵安裝,使現有工具(如 Claude Code、Codex)無縫連線開源模型。 Fireworks AI 推出 Kimi K3 的 LoRA 訓練:前沿智慧,觸手可及 2026-07-27 23:51 UTC+8 Fireworks AI 為其巨大的 MoE 模型 Kimi K3(約 2.8 萬億引數)推出了無伺服器 LoRA 訓練。LoRA 介面卡訓練成本低,服務靈活,可將細微調整成本降至幾乎為零。透過兩個任務示例(Countdown 和 Frozen Lake)展示了小介面卡如何快速教模型新目標或工具使用迴圈。文章還強調了獎勵設計的重要性,以及資料飛輪效應。
Fireworks 推出 Kimi K3 的無伺服器 LoRA 訓練,按 token 付費,無需管理 GPU 叢集。 LoRA 介面卡僅幾 MB,可針對特定行為進行低成本微調,支援即時合併或多 LoRA 部署。 Kimi K3 登入 Fireworks:觸手可及的前沿智慧 2026-07-27 23:51 UTC+8 Kimi K3 是首個達到 2.8 萬億引數的開源模型,效能媲美甚至超越 Fable 5、Opus 5 和 GPT 5.5 等閉源模型。Fireworks 提供美國伺服器託管、零資料保留的推理與訓練服務,使用者可按需使用,無需管理 GPU 基礎設施。
Kimi K3 擁有 2.8T 引數,啟用率僅 1.14%,在多項基準測試中領先。 在程式設計、寫作、法律分析、客服和多模態任務上表現卓越。 2026年最佳開源大語言模型:我們評測了7個模型 2026-07-27 07:49 UTC+8 本文評測了截至2026年中期的9個開源大語言模型,從基準測試、上下文視窗、多模態支援和許可證等方面進行比較。文章指出Kimi K3效能領先,但權重尚未完全開放;GLM 5.2是目前在Fireworks上可用的最佳開源模型。DeepSeek-V4-Pro、MiniMax M3和gpt-oss-120b等模型針對特定用例進行評估。
Kimi K3在基準測試中領先,但完整權重預計2026年7月才釋出。 GLM 5.2是Fireworks上可用的最佳開源模型,擁有1,040k上下文視窗。 Heidi x Fireworks:縮小前沿模型效能差距 2026-07-22 05:32 UTC+8 Heidi Health與Fireworks AI合作,透過監督微調(SFT)和強化微調(RFT)技術,在臨床試驗筆記資料集上超越了Gemini Pro等前沿模型。合作伙伴關係不僅將延遲從25秒降至7秒,還實現了3.5倍的效能提升。成功的關鍵在於高質量資料過濾和大批次訓練(有效批次大小達150萬token),有效消除了噪聲並提升了模型質量。
Heidi與Fireworks合作,從封閉模型轉向開放模型,獲得更高效能和成本節約。 透過SFT和RFT,模型質量超越前沿模型,在內部評估中表現更優。 Kimi K3 與 Fable 競爭;Kimi K3 + Fable 達到 SOTA 2026-07-22 03:32 UTC+8 Fireworks AI 釋出新研究,開源模型 Kimi K3 與閉源模型 Fable 5 在約 1000 個智慧體任務上對比,透過任務路由兩者結合可實現 93% 準確率,成本降低最高達 50 倍,表明最佳 AI 來自模型組合而非單一模型。
Kimi K3 和 Fable 5 在整體效能上接近,但在不同任務領域各有專長。 透過神諭路由,K3 被選中處理 72-96% 的任務,組合效能超過任何單一模型。 在NVIDIA Blackwell上最佳化MiniMax M3稀疏注意力 2026-07-16 21:16 UTC+8 Fireworks AI團隊為MiniMax M3稀疏注意力開發了Blackwell(SM100)核心,採用KV-固定執行路徑,每個KV塊只載入一次,實現了約980 TFLOP/s的吞吐量和4.1 TB/s的HBM頻寬,相比查詢固定基線(FlashInfer)加速1.9–2.4倍,相比開源MSA核心加速約1.6倍。本文詳細介紹了演算法、核心設計、最佳化及I/O成本模型。
稀疏注意力透過減少計算和記憶體成本加速長上下文推理,但資料依賴的選擇導致不規則訪存,抵消理論加速。 Fireworks AI的KV-固定核心透過外迴圈載入選中的KV塊,內迴圈處理所有選擇該塊的查詢,實現高效計算。 Fireworks完成15億美元D輪融資 2026-07-16 21:15 UTC+8 Fireworks宣佈完成15.05億美元D輪融資,估值達175億美元,公司年經常性收入突破10億美元,每日處理超過40萬億個token,其中95%以上來自客戶專有資料最佳化的模型。
Fireworks在D輪融資中籌集15.05億美元,估值175億美元。 公司年化收入超過10億美元,每日處理40萬億token。 Gumloop藉助Fireworks AI在3周內將開源模型使用量提升7倍 2026-07-11 04:57 UTC+8 Gumloop透過與Fireworks AI合作,在三週內將開源模型代理對話量提升7倍,成本降低高達72%,同時保持輸出質量不變。
Gumloop將其內部代理從Opus 4.8遷移到GLM-5.2,使用者未察覺到差異。 實現了72%的成本節省,開源模型使用量增長7倍。 開放、前沿、屬於你:LangChain Deep Agents 在 NVIDIA Nemotron 3 Ultra 上執行於 Fireworks 2026-07-10 02:54 UTC+8 LangChain 為 NVIDIA Nemotron 3 Ultra 調優了 Deep Agents 框架,實現了開源模型中領先的智慧體效能,成本僅為閉源替代方案的十分之一。該模型在 Fireworks 上執行,支援後訓練定製,幫助企業構建專屬智慧。
LangChain Deep Agents 在 Nemotron 3 Ultra 上表現卓越,成本降低 10 倍。 Fireworks 提供最佳化推理棧,支援模型後訓練和部署。 如何用 GLM 5.2 Fast 在四天內完成一個月的工程工作量 2026-07-09 08:52 UTC+8 作者使用 FireConnect 上的 GLM 5.2 Fast 模型,在 Claude Code 的輔助下,僅用四天時間和 218 美元的推理成本,完成了一項通常需要一個月才能完成的 GPU 排程器回收功能。文章詳細介紹了問題背景、工作流程(設計、規劃、實現)以及成功的關鍵因素:快速推理消除了上下文切換成本,低成本消除了對 token 使用的顧慮,模型質量保證了複雜邏輯的正確性。
透過 FireConnect 在 Claude Code 上使用 GLM 5.2 Fast,在四天內完成了 GPU 排程器的回收功能。 專案產出包括 4 個 PR、約 3000 行程式碼、16 個單元測試和 18 個整合測試,全部透過。 GLM 5.2 Fast 現已在 Fireworks 上線 2026-07-08 08:48 UTC+8 GLM 5.2 Fast 在 Fireworks 平臺上線,提供 Opus 級別的智慧和開源價格,無需合同,按 token 付費。該模型專為智慧體迴圈最佳化,支援 1M token 上下文視窗,快速推理速度達 446 tok/sec,並具有主動提示快取和結構化輸出支援。Fireworks 透過最佳化 MoE 和稀疏注意力架構實現了高效能,同時保持質量不變。
GLM 5.2 Fast 執行速度比標準路徑快 2-3 倍,支援 1M token 上下文視窗和主動提示快取。 Fireworks 最佳化了模型的 MoE 和稀疏注意力架構,實現了獨立的分片策略。 Factory 如何在六個月內透過 Fireworks 將開源模型使用量提升 2-3 倍 2026-07-01 04:27 UTC+8 Factory 是一家構建智慧體原生軟體開發的公司,其 Droid 智慧體覆蓋整個軟體開發生命週期。透過採用 Fireworks 的開源模型推理平臺,Factory 在六個月內將開源模型使用量提升了 2-3 倍,同時將任務成本降至前沿模型的 6%-20%,吞吐量提升了 5-15 倍。這得益於 Fireworks 提供的模型全覆蓋、零日可用、高可靠性和低延遲。
Factory 透過 Fireworks 平臺實現對所有開源模型的零日訪問,大幅提升模型使用量。 開源模型成本僅為前沿模型的 6%-20%,同時保持高質量,使自動化更具經濟性。 Cursor Composer 2 + Fireworks AI 2026-06-27 06:15 UTC+8 Cursor 釋出了 Composer 2,這是一款為 Cursor 開發環境最佳化的編碼模型。它基於 Kimi 2.5,結合持續預訓練和大規模強化學習,實現了前沿的編碼效能,同時推理成本降低 6-10 倍。Fireworks AI 提供分散式推理基礎設施,使強化學習規模化成為可能。
Composer 2 是 Cursor 為其開發環境量身定製的編碼模型,透過持續預訓練和強化學習提升效能。 該模型在 CursorBench、Terminal-Bench 和 SWE-bench Multilingual 上取得領先分數。 低成本前沿AI:開源工作者與閉源顧問的組合方案 2026-06-27 02:14 UTC+8 本文介紹了一種開源工作者(如Kimi-K2.6或GLM-5.2)與閉源前沿顧問(Claude Opus 4.8)相結合的AI代理架構。該方案在SWE-bench Pro、Terminal-Bench 2.1和Legal Agent Bench三個基準測試中均實現了穩定效能提升,同時將推理成本降低19%至67%。GLM-5.2搭配顧問在Terminal-Bench上達到與Opus相當的水平(約80%),在Legal Agent Bench上甚至超越Opus,成本卻低40%。
開源工作者(Kimi-K2.6或GLM-5.2)端到端驅動任務,在最終階段諮詢閉源前沿模型(Claude Opus 4.8)一次。 SWE-bench Pro提升4至7個百分點,Terminal-Bench 2.1提升4至8個百分點,Legal Agent Bench提升1至4個百分點。 Fireworks AI 2026-06-20 05:55 UTC+8 Fireworks AI 宣佈自2026年7月1日起,所有自助服務賬戶將遷移至預付費計費模式。使用者可立即切換或等待自動遷移,預付費模式透過預先購買信用額度實現費用可預測,自動充值功能可避免服務中斷。簽約客戶不受影響。
Fireworks AI 將於2026年7月1日起將自助服務賬戶遷移至預付費計費。 使用者可選擇立即切換或等待自動遷移。 GLM 5.2 在 Fireworks 推理平臺上線,零日可用 2026-06-19 05:52 UTC+8 智譜(Z.ai)釋出的最新開源模型 GLM 5.2 現已透過 Fireworks 推理平臺提供。該模型在程式設計基準測試中表現領先,擁有100萬token的上下文視窗,適用於長週期代理任務,並採用MIT許可證。Fireworks 獨立驗證了模型效能,並強調其基礎設施優勢而非路由。
GLM 5.2 零日上線 Fireworks 推理平臺,由智譜(Z.ai)釋出,該模型專為長週期程式設計任務設計。 擁有100萬token的上下文視窗,在 GPQA-Diamond 基準測試中得分91.4%,經 Fireworks 獨立驗證。 Fireworks 上的 Kimi K2.7 Code:更優的代理,更低的單任務成本,上線首日可用 2026-06-17 05:46 UTC+8 月之暗面(Moonshot AI)釋出 Kimi K2.7 Code,這是 K2 系列的最新程式設計模型,現已透過 Fireworks AI 提供 Day-0 支援。相比 K2.6,該模型推理 token 減少約 30%,同時在程式設計評測中得分更高。推理 token 的減少顯著降低了代理工作流的單任務成本。Fireworks 提供標準、優先和快速(即將推出)三種服務層級,滿足不同可靠性和速度需求。
Kimi K2.7 Code 比 K2.6 少用約 30% 的推理 token,但在程式設計評測中表現更優。 減少推理 token 透過複合效應降低了代理工作流的整體任務成本。 Qwen 3.7 Plus 現已在 Fireworks 上線 2026-06-13 13:37 UTC+8 阿里巴巴與 Fireworks 合作,在 Fireworks 基礎設施上獨家託管 Qwen 3.7 Plus 模型。該模型專為智慧體迴圈設計,支援思考與非思考模式,上下文視窗達 262K token,並在多項基準測試中表現優異。Fireworks 作為推理提供商,提供高效能、低延遲的推理服務,資料零保留,SLA 達 99.9%。定價較前代便宜約 50%。
Qwen 3.7 Plus 是阿里巴巴的旗艦多模態模型,現透過 Fireworks 的 Serverless API 提供服務。 模型專為智慧體工作負載最佳化,支援思維鏈保留和多模態輸入。 MiniMax M3 正式上線:長上下文 + 原生多模態,價格僅為 1/20 2026-06-13 13:36 UTC+8 MiniMax 釋出旗艦模型 M3,具備超 50 萬 token 上下文視窗、原生多模態能力(文本、影像、影片),並採用創新的 MiniMax 稀疏注意力(MSA)架構,大幅提升推理效率。在 Fireworks 平臺上,M3 價格僅為 M2.7 的 1/20,旨在為開源社群提供前沿水平的編碼和智慧體能力。
MiniMax M3 支援超過 500K token 的上下文視窗,未來將擴充套件到 1M token。 採用 MiniMax 稀疏注意力(MSA)架構,計算效率提升 4 倍以上。 NVIDIA Nemotron 3 Ultra 在 Fireworks 上線,零日支援 2026-06-13 01:37 UTC+8 NVIDIA 釋出 Nemotron 3 Ultra 開源模型,專為長時自主代理任務最佳化,擁有 550B 總引數、混合 Transformer-Mamba MoE 架構,可在 Fireworks 平臺零日部署。該模型在代理任務上推理速度提升 5 倍,成本降低 30%,支援從訓練到生產的一體化流程。
Nemotron 3 Ultra 是專為長執行自主代理設計的開源模型,總引數 550B,活躍引數 55B。 採用混合 Transformer-Mamba MoE 架構,支援高達 1M 上下文。 開源代理與前沿顧問:透過訓練和引擎工程匹配前沿效能 2026-06-05 01:51 UTC+8 Fireworks AI 和 Harvey 在 Legal Agent Benchmark (LAB) 上探索了兩種系統級技術,以降低對單一前沿模型的依賴,同時以更低成本實現前沿級效能。混合引擎使用開源 GLM 5.1 工作器和 Claude Opus 4.7 顧問,在 100 個任務上以 368 美元成本實現 18/100 的全透過率,超過了僅使用 Opus 的 14/100(成本 954 美元)。對 Kimi K2.6 進行監督微調 (SFT) 和強化微調 (RFT) 後,全透過率以 84 美元成本達到 15/100,平均分從 0.863 提升至 0.886。
混合引擎使用開源工作器和前沿顧問作為可呼叫工具,以低於端到端前沿模型的成本實現更高的全透過率。 Fireworks 上的後訓練:SFT 將全透過率從 11/100 提升至 15/100;RFT 將平均分從 0.863 提高至 0.886。 Trilogy 藉助 Fireworks AI 驗證開源權重模型在企業工作負載中的表現 2026-06-04 01:47 UTC+8 Trilogy 的 AI 卓越中心評估了 Fireworks AI 作為推理基礎設施,以標準化開源權重模型的使用,降低了成本並實現了十億級 token 的代理工作流。
Trilogy 採用 Fireworks AI 作為企業級開源權重模型的推理層。 成本降至專有系統的約五分之一,避免了速率限制問題。 智慧體執行稅:大模型在瀏覽器自動化中的真正瓶頸 2026-06-02 01:42 UTC+8 在720次瀏覽器代理任務基準測試中發現,模型在結構化輸出可靠性上的差異導致高達22.9%的執行稅(浪費的推理呼叫佔比)。Kimi K2.5實現零執行稅,而Gemini 2.5 Flash在近五分之一的呼叫中出現JSON格式錯誤。這種執行開銷不僅增加了成本,還放大了延遲和任務失敗風險。
智慧體執行稅衡量因無效結構化輸出而產生的冗餘推理呼叫比例,Gemini高達22.9%,而Kimi為零。 結構化輸出可靠性是核心瓶頸:Gemini每5次呼叫就有1次解析失敗,導致87%的任務至少經歷一次重試。 Serverless 2.0:三種推理執行方式,一個API 2026-05-29 09:34 UTC+8 Fireworks AI推出Serverless 2.0,在無需預留容量的情況下,透過一個API提供標準、優先和快速三種推理服務路徑。標準路徑是預設的彈性共享基礎設施,優先路徑在高負載下提供更強的准入保障,快速路徑則實現約兩倍的生成令牌吞吐量。同時,該版本將負載丟棄和速率限制錯誤碼分離,明確區分429和503狀態碼,幫助開發者編寫正確的重試邏輯和警報配置。
Serverless 2.0 提供三種服務意圖:標準(預設)、優先(高負載下優先准入)和快速(高吞吐量)。 優先路徑在峰值負載測試中實現了0%的503錯誤率,而標準路徑為0.082%。 創新解決方案藉助 Fireworks AI 重構企業服務交付 2026-05-21 08:15 UTC+8 作為 AWS 頂級合作伙伴,創新解決方案公司透過將推理層遷移至 Fireworks AI,實現了服務交付的變革。其 DarcyIQ 平臺從內部效率工具發展為多智慧體執行系統,合同週期從 30-45 天縮短至約 3 天,交付吞吐量翻倍,推理成本從線性增長轉變為可預測的單位經濟學。
創新解決方案公司將推理層從 Anthropic 遷移至 Fireworks AI,降低了模型整合開銷,實現了穩定且成本可控的推理。 DarcyIQ 平臺進化為多智慧體執行系統,覆蓋銷售、範圍界定和交付全生命週期,合同週期縮短至約 3 天。 Fireworks AI 收購 Hathora 以加速全球計算編排 2026-05-15 10:31 UTC+8 Fireworks AI 宣佈收購專為低延遲即時工作負載打造全球容器編排平臺的公司 Hathora。此次收購旨在將 Hathora 在遊戲領域積累的毫秒級延遲最佳化技術應用於 AI 推理,以提升全球推理速度和可靠性。
Fireworks AI 收購 Hathora,整合其容器編排技術。 Hathora 專注於毫秒級延遲最佳化,應用於 AI 推理。 Fireworks AI 登陸 Microsoft Foundry,為 Azure 帶來頂級開源模型推理服務 2026-05-15 10:30 UTC+8 Fireworks AI 宣佈在 Microsoft Foundry 上推出公開預覽版,將其高效能開源模型推理服務整合到 Azure 平臺。該合作使開發者能夠透過統一的 Foundry 平臺訪問 DeepSeek V3.2、Kimi K2.5 等領先開源模型,並支援自帶權重、按需擴充套件及企業級治理。
Fireworks AI 在 Microsoft Foundry 上提供公開預覽版,將高效能開源模型推理引入 Azure。 首批模型包括 DeepSeek V3.2、Kimi K2.5、MiniMax M2.5 等,支援自帶權重和靈活定價。