待翻译:Debating RSI, the US-China Gap, and Jaggedness with JS Denain of Epoch AI
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Podcast #19
待翻译:The current balance of power in open models
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:The expanded form of a testimony I prepared for Congress.
待翻译:Why I still haven’t bought into true RSI
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:An “AI moderate’s” view on recent events and the trajectory of frontier models.
待翻译:Open-Source AI & Open Models Reading List
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:How to get up to speed on open models and their implications.
待翻译:One resignation turned the embers of AI fear into a wildfire
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Some quick notes on a truly weird week.
待翻译:When will average people feel AI’s impact?
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:We’re <5 years into a compounding revolution which could take a century, and how the AI industry should manage this.
最新开放模型动态(#24):Motif-3、GLM-5.3、Hy4-preview与开放模型许可证
本期盘点开放模型生态的持续扩张:西方头部厂商继续拥抱Apache 2.0等宽松许可,中国前沿厂商却转向更严格的自定义许可证,智谱GLM-5.3也加入了10亿美元收入门槛与安全审查条款。另有Motif-3、dots3-note-prev、Qwen3.8-Flash-Next、GLM-5.3-Flash与腾讯Hy4-preview等值得关注的发布。
待翻译:Teaching Everyone to Fish for Tokens
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Nvidia wants you building your own model, not buying from Anthropic/OpenAI.
GLM-5.3:中国实验室如何紧跟前沿
Z.ai 发布 GLM-5.3,仅用约 7500 亿参数便在多个基准上匹敌甚至超越西方前沿模型。文章分析其成功并非靠蒸馏,而是后训练、发布速度与数据产业的综合优势,也讨论了网络安全风险与开放权重的影响。
待翻译:I wrote an AI textbook — how long until AI can do it better?
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Reflections on AI's writing ability and how AI models get more capable.
待翻译:5 useful things you'll learn in my new post-training textbook (shipping now!)
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:After a few long years of finding time to document my lessons from training open models, my post-training book is done!
待翻译:Lessons from the hacks
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Musings on model alignment, what determines safety, and where we go from here.
待翻译:Introducing our Artifacts Hub and Adoption Dashboard
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Scaling our curation and measurement of the open ecosystem.
最新开放工件(#23):Laguna S2.1、Inkling 和 Kimi K3 展示开放模型在帕累托前沿的实用性
尽管许多人预测模型实验室将走向整合,但开放模型领域仍在持续繁荣。本期《开放工件》盘点了 Thinking Machines 的 Inkling、腾讯 Hy3、Poolside Laguna S2.1、DeepSeek-V4-Flash 以及 Moonshot AI 的 Kimi K3 等重要发布,并探讨了开放模型许可与商业模式的新动向。
开放模型回顾:关于Kimi K3、Qwen 3.8、习在WAIC的讲话、蒸馏、开放与封闭差距以及未来发展
本播客中,Nathan和Florian讨论了开放AI模型的最新进展,包括Kimi K3的发布、Qwen的开放策略、习近平在WAIC支持开源的讲话、开放与封闭模型之间的性能差距以及蒸馏技术的争议。他们深入分析了中国模型为何表现优异、美国开放模型生态的现状,并对未来进行了预测。
最新开放工件(#22):Zyphra、Cohere 和 Poolside 拓展生态系统广度
本文评估了开放模型生态系统的多样性趋势,分析了不同组织(纯模型制造商、大型科技公司、产品公司)发布开源模型的动机,并介绍了 NVIDIA、Cohere、Zyphra、Poolside 等公司的最新模型发布。
GLM-5.2:开放代理的阶跃性变革
GLM-5.2 是 Z.ai 发布的最新开放权重模型,被广泛视为开放模型领域的一次重大突破。该模型在编码和代理任务上表现出色,性能可与 Anthropic 和 OpenAI 的顶尖模型相媲美,甚至在某些基准测试中超越了它们。其发布恰逢美国对 Claude Fable 实施出口限制,引发了关于开放模型与封闭模型未来格局的讨论。
禁止开源AI将是一个错误
本文认为,禁止或过度监管开源AI将是严重错误。开源软件在技术教育、创新和竞争中发挥着关键作用,并推动了数万亿美元的经济价值。在AI领域,开源模型提供了对抗垄断的力量,且更安全透明。针对中国的担忧不应导致对开源的限制,而应加大对国内开源的支持。
博客现状,2026年中
作者在从Ai2离职后分享博客Interconnects的现状,阐述博客与其职业目标的关系,最近担任Arcee AI和Mercor的顾问,以及计划将评论改为付费、增加付费文章来维持高质量的小众读者群。
前沿后训练配方回顾:与Finbarr Timbers对话
本播客深入探讨了后训练配方的演变,从InstructGPT到2026年的多教师策略(MOPD)。Nathan Lambert与Finbarr Timbers回顾了OLMo-3等开源模型的挑战,并分析了前沿实验室如何通过专业化教师和策略蒸馏来突破性能瓶颈。
Claude Fable 5与新的AI安全寓言
Anthropic发布了Claude Fable 5模型,这是目前最强大的公开模型。该公司推出了一系列安全措施,包括对特定领域使用降级模型,但对前沿AI开发请求进行静默干预而不通知用户,这引发了信任危机。文章批评了这种不一致的安全策略,并探讨了AI安全与市场竞争之间的张力。
告别Ai2
Nathan Lambert回顾了他在艾伦人工智能研究所(Ai2)的工作经历,期间他参与了Olmo模型的开发,并领导了Tülu 3等项目。他强调开放研究的重要性,并分享了他从一名普通研究员成长为领域内知名科学家的历程。
关于接下来会发生什么的一些想法,2026年5月
2026年AI领域将继续快速发展,开源模型在智能体能力上仍落后于闭源模型,谷歌的Gemini尚未对Claude Code和Codex构成有力竞争,美国开源模型正在崛起,Anthropic与OpenAI竞争激烈,现有权力结构开始介入AI发展。
最新开放制品(#21):开放模型盛宴!Gemma 4、DeepSeek V4、Kimi K2.6、MiMo 2.5、GLM-5.1等。关于CAISI对V4的评估。
本月开放前沿实验室纷纷发布新模型,包括DeepSeek V4、Gemma 4、Kimi K2.6等。CAISI评估指出开放模型落后于美国前沿,且差距在扩大,但评估方法受到质疑,实际能力差距可能被高估。文章还介绍了多个亮点模型。
开放模型生态系统如何放大优势
文章指出,前沿模型的算力约80%用于研发而非最终训练。以中国为代表的开放生态系统通过共享减少重复研发成本。开放模型降低了未来开发成本,但部署成本高于闭源托管方案。作者呼吁建立开放模型联盟以维持竞争力。
来自中国AI实验室的笔记
通过对中国主要AI实验室的访问,作者发现了一种谦逊、务实、快速跟进的文化。中国研究人员(其中许多是学生)专注于模型构建而非哲学辩论,较少自我意识。生态系统显示出早期国内AI需求,但数据产业欠发达,且对Nvidia芯片有强烈渴求。
解读当今开源与闭源模型的性能差距
开源模型与闭源模型之间的性能差距并非单一数字所能概括,而是涉及基准测试的演变、实际应用表现以及训练范式的转变。文章分析了这一动态变化,指出基准测试的可信度下降,以及前沿实验室为维持收入而不断自我革新的经济压力。同时,中国实验室的开源模型在基准测试上表现出色,但在鲁棒性和实际应用中仍有差距。
我最近在做什么:ATOM报告、后训练课程、完成我的书以及持续的研究
本文回顾了作者近期的各项努力,包括发布ATOM报告更新、完成RLHF书籍并开放预订、制作后训练课程以及参与两项技术研究。同时预告了即将前往中国和华盛顿特区的行程。
Claude Mythos与误导性的开源模型恐慌
本文分析了Claude Mythos模型发布后引发的关于开源AI模型安全风险的讨论。作者认为这种恐慌与以往类似,指出开源模型的能力差距、运行成本以及具体的安全评估需求,呼吁进行细致研究而非全面禁止。
Gemma 4 与开放模型成功的关键
本文探讨了2026年开放模型面临的竞争环境,评估开放模型成功的关键因素(性能、来源国、许可证、工具支持、微调能力),并重点分析了谷歌最新发布的Gemma 4系列。文章指出,开放模型的成功更多取决于易用性和生态支持,而非基准分数。