开放模型回顾:关于Kimi K3、Qwen 3.8、习在WAIC的讲话、蒸馏、开放与封闭差距以及未来发展
本播客中,Nathan和Florian讨论了开放AI模型的最新进展,包括Kimi K3的发布、Qwen的开放策略、习近平在WAIC支持开源的讲话、开放与封闭模型之间的性能差距以及蒸馏技术的争议。他们深入分析了中国模型为何表现优异、美国开放模型生态的现状,并对未来进行了预测。
在一期关于开放模型现状的深度播客中,Nathan Lambert和Florian Brand围绕Kimi K3的发布展开了讨论。Kimi K3是近期最受关注的开放权重模型之一,其性能在某些任务上令人惊艳,尤其是编码和数据分析。Nathan分享了他使用Kimi K3的经历:在订阅其最高级别服务后,他发现该模型在涉及网络爬取和Reddit分析等任务时表现独特,甚至能发现传统模型忽略的洞察。然而,由于服务器位于中国且用户过多,API响应速度较慢,影响了实际使用体验。
Florian则从工程实践角度评价了Kimi K3。他认为该模型生成的代码更简洁易读,但功能深度上略逊于Codex或Claude。尽管如此,对于监督实验或快速原型开发,Kimi K3已足够实用。他同时提到了GLM 5.2的持续价值,称其为“Sonnet级别”的模型,适合作为子代理任务。
两人还探讨了中国模型为何如此出色。他们认为,中国实验室在数据、环境和训练规模上投入巨大,加上政府对开源战略的支持(如习近平在WAIC的讲话),推动了模型能力的快速提升。Qwen宣布其下一代模型将开放权重,标志着开放生态的重大转变。
关于开放与封闭模型的差距,Nathan强调这种差距因任务而异。在软件工程等领域,开放模型可能仅落后几个月,但这一差距对特定用例(如Claude Code)至关重要。他预测,通过后训练优化,开放模型有望在特定领域超越封闭模型。Florian则指出,人们往往用不同基准来夸大或缩小差距,实际表现取决于具体场景。
蒸馏技术成为另一个焦点。两人批评了一些关于蒸馏的片面观点,认为蒸馏并非简单的复制,而是需要结合创新。他们预测,未来开放模型将继续加速发展,但基础设施和后训练能力将成为关键瓶颈。整体而言,开放模型生态正快速专业化,但与封闭模型仍存在动态博弈。
此外,播客中还讨论了美国开放模型生态的现状,包括对前沿与近前沿模型的区分,以及网络安全方面的论据。两人对未来的模型层级进行了预测,并展望了开放与封闭模型之间的竞争趋势。
最后,他们还提到Nath的新书《后训练知识分享》即将发布,该书目前已成为亚马逊AI类第一名。