待翻译:Three Tests to Run Before You Switch from LoRA to FullFT 2026-08-08 00:26 UTC+8 AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Three Tests to Run Before You Switch from LoRA to FullFT Kimi K3 on Fireworks: Frontier Intelligence You Can Own Blog Three Tests To Run Before You Switch From Lora To Fullft Three Tests to Run Before You Switch from Lo…
AI 服务暂时不可用,系统已先保留来源内容与降级元数据。 Three Tests to Run Before You Switch from LoRA to FullFT Kimi K3 on Fireworks: Frontier Intelligence You Can Own Blog Three Tests To Run Before You Switch From Lora To Fullft Thre… Trilogy 利用 Kimi K3 实现开放权重网络安全的策略手册 2026-07-29 09:55 UTC+8 Trilogy 人工智能卓越中心发布了基于 Fireworks 平台 Kimi K3 的网络安全策略手册。该手册强调开放权重模型在防御型人工智能中的优势,能够支持连续、高容量的安全工作流程,无需依赖受限或昂贵的模型。手册详细介绍了实用参考堆栈:确定性工具负责结构化和事实提取,Kimi K3 负责判断,并采用路径为中心的审计方法。Fireworks 提供托管推理服务,使团队可以独立扩展,同时保留对审计工作流的控制。
Trilogy 的策略手册利用 Fireworks 上的 Kimi K3 进行开放权重网络安全,强调部署灵活性。 手册将确定性工具(索引、解析)与 AI 判断(Kimi K3)分离,提高安全审计效率。 Fireworks Nexus:即插即用的开放前沿智能,专为有预算限制的团队打造 2026-07-28 01:51 UTC+8 Fireworks AI 推出 Fireworks Nexus,帮助工程团队在不改变工作流程的情况下,通过智能路由将日常任务分配给经济高效的开源模型,从而显著降低 AI 支出。初步测试显示,它能将每合并 PR 的成本降低三分之一,混合 Token 费率约为封闭模型实验室的四分之一。
Fireworks Nexus 提供企业级控制、成本可观测性和工作流连续性,允许团队集中管理 AI 使用。 FireConnect 一键安装,使现有工具(如 Claude Code、Codex)无缝连接开源模型。 Fireworks AI 推出 Kimi K3 的 LoRA 训练:前沿智能,触手可及 2026-07-27 23:51 UTC+8 Fireworks AI 为其巨大的 MoE 模型 Kimi K3(约 2.8 万亿参数)推出了无服务器 LoRA 训练。LoRA 适配器训练成本低,服务灵活,可将细微调整成本降至几乎为零。通过两个任务示例(Countdown 和 Frozen Lake)展示了小适配器如何快速教模型新目标或工具使用循环。文章还强调了奖励设计的重要性,以及数据飞轮效应。
Fireworks 推出 Kimi K3 的无服务器 LoRA 训练,按 token 付费,无需管理 GPU 集群。 LoRA 适配器仅几 MB,可针对特定行为进行低成本微调,支持实时合并或多 LoRA 部署。 Kimi K3 登录 Fireworks:触手可及的前沿智能 2026-07-27 23:51 UTC+8 Kimi K3 是首个达到 2.8 万亿参数的开源模型,性能媲美甚至超越 Fable 5、Opus 5 和 GPT 5.5 等闭源模型。Fireworks 提供美国服务器托管、零数据保留的推理与训练服务,用户可按需使用,无需管理 GPU 基础设施。
Kimi K3 拥有 2.8T 参数,激活率仅 1.14%,在多项基准测试中领先。 在编程、写作、法律分析、客服和多模态任务上表现卓越。 2026年最佳开源大语言模型:我们评测了7个模型 2026-07-27 07:49 UTC+8 本文评测了截至2026年中期的9个开源大语言模型,从基准测试、上下文窗口、多模态支持和许可证等方面进行比较。文章指出Kimi K3性能领先,但权重尚未完全开放;GLM 5.2是目前在Fireworks上可用的最佳开源模型。DeepSeek-V4-Pro、MiniMax M3和gpt-oss-120b等模型针对特定用例进行评估。
Kimi K3在基准测试中领先,但完整权重预计2026年7月才发布。 GLM 5.2是Fireworks上可用的最佳开源模型,拥有1,040k上下文窗口。 Heidi x Fireworks:缩小前沿模型性能差距 2026-07-22 05:32 UTC+8 Heidi Health与Fireworks AI合作,通过监督微调(SFT)和强化微调(RFT)技术,在临床试验笔记数据集上超越了Gemini Pro等前沿模型。合作伙伴关系不仅将延迟从25秒降至7秒,还实现了3.5倍的性能提升。成功的关键在于高质量数据过滤和大批量训练(有效批量大小达150万token),有效消除了噪声并提升了模型质量。
Heidi与Fireworks合作,从封闭模型转向开放模型,获得更高性能和成本节约。 通过SFT和RFT,模型质量超越前沿模型,在内部评估中表现更优。 Kimi K3 与 Fable 竞争;Kimi K3 + Fable 达到 SOTA 2026-07-22 03:32 UTC+8 Fireworks AI 发布新研究,开源模型 Kimi K3 与闭源模型 Fable 5 在约 1000 个智能体任务上对比,通过任务路由两者结合可实现 93% 准确率,成本降低最高达 50 倍,表明最佳 AI 来自模型组合而非单一模型。
Kimi K3 和 Fable 5 在整体性能上接近,但在不同任务领域各有专长。 通过神谕路由,K3 被选中处理 72-96% 的任务,组合性能超过任何单一模型。 在NVIDIA Blackwell上优化MiniMax M3稀疏注意力 2026-07-16 21:16 UTC+8 Fireworks AI团队为MiniMax M3稀疏注意力开发了Blackwell(SM100)内核,采用KV-固定执行路径,每个KV块只加载一次,实现了约980 TFLOP/s的吞吐量和4.1 TB/s的HBM带宽,相比查询固定基线(FlashInfer)加速1.9–2.4倍,相比开源MSA内核加速约1.6倍。本文详细介绍了算法、内核设计、优化及I/O成本模型。
稀疏注意力通过减少计算和内存成本加速长上下文推理,但数据依赖的选择导致不规则访存,抵消理论加速。 Fireworks AI的KV-固定内核通过外循环加载选中的KV块,内循环处理所有选择该块的查询,实现高效计算。 Fireworks完成15亿美元D轮融资 2026-07-16 21:15 UTC+8 Fireworks宣布完成15.05亿美元D轮融资,估值达175亿美元,公司年经常性收入突破10亿美元,每日处理超过40万亿个token,其中95%以上来自客户专有数据优化的模型。
Fireworks在D轮融资中筹集15.05亿美元,估值175亿美元。 公司年化收入超过10亿美元,每日处理40万亿token。 Gumloop借助Fireworks AI在3周内将开源模型使用量提升7倍 2026-07-11 04:57 UTC+8 Gumloop通过与Fireworks AI合作,在三周内将开源模型代理对话量提升7倍,成本降低高达72%,同时保持输出质量不变。
Gumloop将其内部代理从Opus 4.8迁移到GLM-5.2,用户未察觉到差异。 实现了72%的成本节省,开源模型使用量增长7倍。 开放、前沿、属于你:LangChain Deep Agents 在 NVIDIA Nemotron 3 Ultra 上运行于 Fireworks 2026-07-10 02:54 UTC+8 LangChain 为 NVIDIA Nemotron 3 Ultra 调优了 Deep Agents 框架,实现了开源模型中领先的智能体性能,成本仅为闭源替代方案的十分之一。该模型在 Fireworks 上运行,支持后训练定制,帮助企业构建专属智能。
LangChain Deep Agents 在 Nemotron 3 Ultra 上表现卓越,成本降低 10 倍。 Fireworks 提供优化推理栈,支持模型后训练和部署。 如何用 GLM 5.2 Fast 在四天内完成一个月的工程工作量 2026-07-09 08:52 UTC+8 作者使用 FireConnect 上的 GLM 5.2 Fast 模型,在 Claude Code 的辅助下,仅用四天时间和 218 美元的推理成本,完成了一项通常需要一个月才能完成的 GPU 调度器回收功能。文章详细介绍了问题背景、工作流程(设计、规划、实现)以及成功的关键因素:快速推理消除了上下文切换成本,低成本消除了对 token 使用的顾虑,模型质量保证了复杂逻辑的正确性。
通过 FireConnect 在 Claude Code 上使用 GLM 5.2 Fast,在四天内完成了 GPU 调度器的回收功能。 项目产出包括 4 个 PR、约 3000 行代码、16 个单元测试和 18 个集成测试,全部通过。 GLM 5.2 Fast 现已在 Fireworks 上线 2026-07-08 08:48 UTC+8 GLM 5.2 Fast 在 Fireworks 平台上线,提供 Opus 级别的智能和开源价格,无需合同,按 token 付费。该模型专为智能体循环优化,支持 1M token 上下文窗口,快速推理速度达 446 tok/sec,并具有主动提示缓存和结构化输出支持。Fireworks 通过优化 MoE 和稀疏注意力架构实现了高性能,同时保持质量不变。
GLM 5.2 Fast 运行速度比标准路径快 2-3 倍,支持 1M token 上下文窗口和主动提示缓存。 Fireworks 优化了模型的 MoE 和稀疏注意力架构,实现了独立的分片策略。 Factory 如何在六个月内通过 Fireworks 将开源模型使用量提升 2-3 倍 2026-07-01 04:27 UTC+8 Factory 是一家构建智能体原生软件开发的公司,其 Droid 智能体覆盖整个软件开发生命周期。通过采用 Fireworks 的开源模型推理平台,Factory 在六个月内将开源模型使用量提升了 2-3 倍,同时将任务成本降至前沿模型的 6%-20%,吞吐量提升了 5-15 倍。这得益于 Fireworks 提供的模型全覆盖、零日可用、高可靠性和低延迟。
Factory 通过 Fireworks 平台实现对所有开源模型的零日访问,大幅提升模型使用量。 开源模型成本仅为前沿模型的 6%-20%,同时保持高质量,使自动化更具经济性。 Cursor Composer 2 + Fireworks AI 2026-06-27 06:15 UTC+8 Cursor 发布了 Composer 2,这是一款为 Cursor 开发环境优化的编码模型。它基于 Kimi 2.5,结合持续预训练和大规模强化学习,实现了前沿的编码性能,同时推理成本降低 6-10 倍。Fireworks AI 提供分布式推理基础设施,使强化学习规模化成为可能。
Composer 2 是 Cursor 为其开发环境量身定制的编码模型,通过持续预训练和强化学习提升性能。 该模型在 CursorBench、Terminal-Bench 和 SWE-bench Multilingual 上取得领先分数。 低成本前沿AI:开源工作者与闭源顾问的组合方案 2026-06-27 02:14 UTC+8 本文介绍了一种开源工作者(如Kimi-K2.6或GLM-5.2)与闭源前沿顾问(Claude Opus 4.8)相结合的AI代理架构。该方案在SWE-bench Pro、Terminal-Bench 2.1和Legal Agent Bench三个基准测试中均实现了稳定性能提升,同时将推理成本降低19%至67%。GLM-5.2搭配顾问在Terminal-Bench上达到与Opus相当的水平(约80%),在Legal Agent Bench上甚至超越Opus,成本却低40%。
开源工作者(Kimi-K2.6或GLM-5.2)端到端驱动任务,在最终阶段咨询闭源前沿模型(Claude Opus 4.8)一次。 SWE-bench Pro提升4至7个百分点,Terminal-Bench 2.1提升4至8个百分点,Legal Agent Bench提升1至4个百分点。 Fireworks AI 2026-06-20 05:55 UTC+8 Fireworks AI 宣布自2026年7月1日起,所有自助服务账户将迁移至预付费计费模式。用户可立即切换或等待自动迁移,预付费模式通过预先购买信用额度实现费用可预测,自动充值功能可避免服务中断。签约客户不受影响。
Fireworks AI 将于2026年7月1日起将自助服务账户迁移至预付费计费。 用户可选择立即切换或等待自动迁移。 GLM 5.2 在 Fireworks 推理平台上线,零日可用 2026-06-19 05:52 UTC+8 智谱(Z.ai)发布的最新开源模型 GLM 5.2 现已通过 Fireworks 推理平台提供。该模型在编程基准测试中表现领先,拥有100万token的上下文窗口,适用于长周期代理任务,并采用MIT许可证。Fireworks 独立验证了模型性能,并强调其基础设施优势而非路由。
GLM 5.2 零日上线 Fireworks 推理平台,由智谱(Z.ai)发布,该模型专为长周期编程任务设计。 拥有100万token的上下文窗口,在 GPQA-Diamond 基准测试中得分91.4%,经 Fireworks 独立验证。 Fireworks 上的 Kimi K2.7 Code:更优的代理,更低的单任务成本,上线首日可用 2026-06-17 05:46 UTC+8 月之暗面(Moonshot AI)发布 Kimi K2.7 Code,这是 K2 系列的最新编程模型,现已通过 Fireworks AI 提供 Day-0 支持。相比 K2.6,该模型推理 token 减少约 30%,同时在编程评测中得分更高。推理 token 的减少显著降低了代理工作流的单任务成本。Fireworks 提供标准、优先和快速(即将推出)三种服务层级,满足不同可靠性和速度需求。
Kimi K2.7 Code 比 K2.6 少用约 30% 的推理 token,但在编程评测中表现更优。 减少推理 token 通过复合效应降低了代理工作流的整体任务成本。 Qwen 3.7 Plus 现已在 Fireworks 上线 2026-06-13 13:37 UTC+8 阿里巴巴与 Fireworks 合作,在 Fireworks 基础设施上独家托管 Qwen 3.7 Plus 模型。该模型专为智能体循环设计,支持思考与非思考模式,上下文窗口达 262K token,并在多项基准测试中表现优异。Fireworks 作为推理提供商,提供高性能、低延迟的推理服务,数据零保留,SLA 达 99.9%。定价较前代便宜约 50%。
Qwen 3.7 Plus 是阿里巴巴的旗舰多模态模型,现通过 Fireworks 的 Serverless API 提供服务。 模型专为智能体工作负载优化,支持思维链保留和多模态输入。 MiniMax M3 正式上线:长上下文 + 原生多模态,价格仅为 1/20 2026-06-13 13:36 UTC+8 MiniMax 发布旗舰模型 M3,具备超 50 万 token 上下文窗口、原生多模态能力(文本、图像、视频),并采用创新的 MiniMax 稀疏注意力(MSA)架构,大幅提升推理效率。在 Fireworks 平台上,M3 价格仅为 M2.7 的 1/20,旨在为开源社区提供前沿水平的编码和智能体能力。
MiniMax M3 支持超过 500K token 的上下文窗口,未来将扩展到 1M token。 采用 MiniMax 稀疏注意力(MSA)架构,计算效率提升 4 倍以上。 NVIDIA Nemotron 3 Ultra 在 Fireworks 上线,零日支持 2026-06-13 01:37 UTC+8 NVIDIA 发布 Nemotron 3 Ultra 开源模型,专为长时自主代理任务优化,拥有 550B 总参数、混合 Transformer-Mamba MoE 架构,可在 Fireworks 平台零日部署。该模型在代理任务上推理速度提升 5 倍,成本降低 30%,支持从训练到生产的一体化流程。
Nemotron 3 Ultra 是专为长运行自主代理设计的开源模型,总参数 550B,活跃参数 55B。 采用混合 Transformer-Mamba MoE 架构,支持高达 1M 上下文。 开源代理与前沿顾问:通过训练和引擎工程匹配前沿性能 2026-06-05 01:51 UTC+8 Fireworks AI 和 Harvey 在 Legal Agent Benchmark (LAB) 上探索了两种系统级技术,以降低对单一前沿模型的依赖,同时以更低成本实现前沿级性能。混合引擎使用开源 GLM 5.1 工作器和 Claude Opus 4.7 顾问,在 100 个任务上以 368 美元成本实现 18/100 的全通过率,超过了仅使用 Opus 的 14/100(成本 954 美元)。对 Kimi K2.6 进行监督微调 (SFT) 和强化微调 (RFT) 后,全通过率以 84 美元成本达到 15/100,平均分从 0.863 提升至 0.886。
混合引擎使用开源工作器和前沿顾问作为可调用工具,以低于端到端前沿模型的成本实现更高的全通过率。 Fireworks 上的后训练:SFT 将全通过率从 11/100 提升至 15/100;RFT 将平均分从 0.863 提高至 0.886。 Trilogy 借助 Fireworks AI 验证开源权重模型在企业工作负载中的表现 2026-06-04 01:47 UTC+8 Trilogy 的 AI 卓越中心评估了 Fireworks AI 作为推理基础设施,以标准化开源权重模型的使用,降低了成本并实现了十亿级 token 的代理工作流。
Trilogy 采用 Fireworks AI 作为企业级开源权重模型的推理层。 成本降至专有系统的约五分之一,避免了速率限制问题。 智能体执行税:大模型在浏览器自动化中的真正瓶颈 2026-06-02 01:42 UTC+8 在720次浏览器代理任务基准测试中发现,模型在结构化输出可靠性上的差异导致高达22.9%的执行税(浪费的推理调用占比)。Kimi K2.5实现零执行税,而Gemini 2.5 Flash在近五分之一的调用中出现JSON格式错误。这种执行开销不仅增加了成本,还放大了延迟和任务失败风险。
智能体执行税衡量因无效结构化输出而产生的冗余推理调用比例,Gemini高达22.9%,而Kimi为零。 结构化输出可靠性是核心瓶颈:Gemini每5次调用就有1次解析失败,导致87%的任务至少经历一次重试。 Serverless 2.0:三种推理运行方式,一个API 2026-05-29 09:34 UTC+8 Fireworks AI推出Serverless 2.0,在无需预留容量的情况下,通过一个API提供标准、优先和快速三种推理服务路径。标准路径是默认的弹性共享基础设施,优先路径在高负载下提供更强的准入保障,快速路径则实现约两倍的生成令牌吞吐量。同时,该版本将负载丢弃和速率限制错误码分离,明确区分429和503状态码,帮助开发者编写正确的重试逻辑和警报配置。
Serverless 2.0 提供三种服务意图:标准(默认)、优先(高负载下优先准入)和快速(高吞吐量)。 优先路径在峰值负载测试中实现了0%的503错误率,而标准路径为0.082%。 创新解决方案借助 Fireworks AI 重构企业服务交付 2026-05-21 08:15 UTC+8 作为 AWS 顶级合作伙伴,创新解决方案公司通过将推理层迁移至 Fireworks AI,实现了服务交付的变革。其 DarcyIQ 平台从内部效率工具发展为多智能体执行系统,合同周期从 30-45 天缩短至约 3 天,交付吞吐量翻倍,推理成本从线性增长转变为可预测的单位经济学。
创新解决方案公司将推理层从 Anthropic 迁移至 Fireworks AI,降低了模型集成开销,实现了稳定且成本可控的推理。 DarcyIQ 平台进化为多智能体执行系统,覆盖销售、范围界定和交付全生命周期,合同周期缩短至约 3 天。 Fireworks AI 收购 Hathora 以加速全球计算编排 2026-05-15 10:31 UTC+8 Fireworks AI 宣布收购专为低延迟实时工作负载打造全球容器编排平台的公司 Hathora。此次收购旨在将 Hathora 在游戏领域积累的毫秒级延迟优化技术应用于 AI 推理,以提升全球推理速度和可靠性。
Fireworks AI 收购 Hathora,整合其容器编排技术。 Hathora 专注于毫秒级延迟优化,应用于 AI 推理。 Fireworks AI 登陆 Microsoft Foundry,为 Azure 带来顶级开源模型推理服务 2026-05-15 10:30 UTC+8 Fireworks AI 宣布在 Microsoft Foundry 上推出公开预览版,将其高性能开源模型推理服务集成到 Azure 平台。该合作使开发者能够通过统一的 Foundry 平台访问 DeepSeek V3.2、Kimi K2.5 等领先开源模型,并支持自带权重、按需扩展及企业级治理。
Fireworks AI 在 Microsoft Foundry 上提供公开预览版,将高性能开源模型推理引入 Azure。 首批模型包括 DeepSeek V3.2、Kimi K2.5、MiniMax M2.5 等,支持自带权重和灵活定价。