AI News HubLIVE
站内改写2 分钟阅读

Fireworks AI 推出 Kimi K3 的 LoRA 训练:前沿智能,触手可及

Fireworks AI 为其巨大的 MoE 模型 Kimi K3(约 2.8 万亿参数)推出了无服务器 LoRA 训练。LoRA 适配器训练成本低,服务灵活,可将细微调整成本降至几乎为零。通过两个任务示例(Countdown 和 Frozen Lake)展示了小适配器如何快速教模型新目标或工具使用循环。文章还强调了奖励设计的重要性,以及数据飞轮效应。

Fireworks AI 今天宣布为其旗舰模型 Kimi K3 提供无服务器 LoRA 训练服务,使开发者能够以极低的成本定制这个拥有约 2.8 万亿参数的混合专家模型。Kimi K3 是首个达到 3 万亿参数规模的开源模型,此前训练这样的庞然大物需要大量基础设施投入,而现在只需在 Fireworks 平台上更改一行代码即可开始。

LoRA(低秩适配)技术通过训练一小部分额外权重(适配器)而非整个模型来工作。适配器文件仅几兆字节,易于存储和部署。Fireworks 提供两种服务方式:实时合并(将单个适配器合并到模型中,实现与基础模型相同的速度)和多 LoRA(在同一部署中托管多个适配器,按请求路由)。由于基础权重只加载一次,添加新适配器的边际成本极低。

无服务器训练的最大优势在于成本效率。用户按 token 付费,无需预定 GPU 集群。一个小规模强化学习运行(约 20 步、86 万个训练 token)总花费约 65 美元,包括训练和采样,30 到 60 分钟内完成。对于多轮 agent 任务,由于采用了 KV 缓存感知技术,重复上下文的预填充费用仅为标准费率的 20%,进一步降低成本。HUD 公司的联创 Lorenss Martinsons 表示,他们的团队可以专注于环境和奖励质量,而无需操心 GPU 集群。

为了展示 LoRA 的威力,Fireworks 团队设计了两个典型任务。第一个是 Countdown 游戏:模型需使用给定数字通过算术运算达到目标值。这主要考验学习新目标的能力。K3 基线约能获得 80% 的分数,而经过约十步训练后,一个简单适配器就让其逼近完美解。第二个是 Frozen Lake 网格导航任务:模型需通过移动工具从起点走到目标点,且不能落入陷阱。这模拟了真实 agent 的观察-行动-观察循环。起初 K3 的成功率接近抛硬币水平,但经过少量训练后,几乎每次都能到达目标。

Fireworks 强调,LoRA 使得训练如此廉价,以至于真正的挑战不再是成本,而是如何设计奖励函数。在 Countdown 任务中,部分奖励提供了密集信号,学习曲线快速上升;而 Frozen Lake 只有到达目标才给奖励,信号稀疏,学习曲线上升较慢。这凸显了奖励设计在模型后训练中的核心作用——即使是全参数训练,如果奖励设计不当也无法成功。

对于有兴趣的开发者,Fireworks 提供了快速入门指南。只需安装 SDK、克隆 cookbook,并运行一条命令即可复现 Countdown 示例。K3 的 LoRA 训练需要申请访问权限。

最后,Fireworks 指出,对于大多数单一行为任务,LoRA 已经足够。全参数训练仍适用于更广泛或全新的场景,如多项无关任务训练、大规模蒸馏或新语言领域。但真正的优势在于训练和服务在同一平台上的循环:训练适配器 → 部署 → 监控 → 收集反馈 → 再次训练。这个数据飞轮随着每轮迭代使模型不断进化,形成越来越宽的护城河。