待翻譯:Debating RSI, the US-China Gap, and Jaggedness with JS Denain of Epoch AI
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Podcast #19
待翻譯:The current balance of power in open models
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:The expanded form of a testimony I prepared for Congress.
待翻譯:Why I still haven’t bought into true RSI
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:An “AI moderate’s” view on recent events and the trajectory of frontier models.
待翻譯:Open-Source AI & Open Models Reading List
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:How to get up to speed on open models and their implications.
待翻譯:One resignation turned the embers of AI fear into a wildfire
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Some quick notes on a truly weird week.
待翻譯:When will average people feel AI’s impact?
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:We’re <5 years into a compounding revolution which could take a century, and how the AI industry should manage this.
最新開放模型動態(#24):Motif-3、GLM-5.3、Hy4-preview與開放模型許可證
本期盤點開放模型生態的持續擴張:西方頭部廠商繼續擁抱Apache 2.0等寬鬆許可,中國前沿廠商卻轉向更嚴格的自定義許可證,智譜GLM-5.3也加入了10億美元收入門檻與安全審查條款。另有Motif-3、dots3-note-prev、Qwen3.8-Flash-Next、GLM-5.3-Flash與騰訊Hy4-preview等值得關注的釋出。
待翻譯:Teaching Everyone to Fish for Tokens
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Nvidia wants you building your own model, not buying from Anthropic/OpenAI.
GLM-5.3:中國實驗室如何緊跟前沿
Z.ai 釋出 GLM-5.3,僅用約 7500 億引數便在多個基準上匹敵甚至超越西方前沿模型。文章分析其成功並非靠蒸餾,而是後訓練、釋出速度與資料產業的綜合優勢,也討論了網路安全風險與開放權重的影響。
待翻譯:I wrote an AI textbook — how long until AI can do it better?
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Reflections on AI's writing ability and how AI models get more capable.
待翻譯:5 useful things you'll learn in my new post-training textbook (shipping now!)
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:After a few long years of finding time to document my lessons from training open models, my post-training book is done!
待翻譯:Lessons from the hacks
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Musings on model alignment, what determines safety, and where we go from here.
待翻譯:Introducing our Artifacts Hub and Adoption Dashboard
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Scaling our curation and measurement of the open ecosystem.
最新開放工件(#23):Laguna S2.1、Inkling 和 Kimi K3 展示開放模型在帕累託前沿的實用性
儘管許多人預測模型實驗室將走向整合,但開放模型領域仍在持續繁榮。本期《開放工件》盤點了 Thinking Machines 的 Inkling、騰訊 Hy3、Poolside Laguna S2.1、DeepSeek-V4-Flash 以及 Moonshot AI 的 Kimi K3 等重要釋出,並探討了開放模型許可與商業模式的新動向。
開放模型回顧:關於Kimi K3、Qwen 3.8、習在WAIC的講話、蒸餾、開放與封閉差距以及未來發展
本播客中,Nathan和Florian討論了開放AI模型的最新進展,包括Kimi K3的釋出、Qwen的開放策略、習近平在WAIC支援開源的講話、開放與封閉模型之間的效能差距以及蒸餾技術的爭議。他們深入分析了中國模型為何表現優異、美國開放模型生態的現狀,並對未來進行了預測。
最新開放工件(#22):Zyphra、Cohere 和 Poolside 拓展生態系統廣度
本文評估了開放模型生態系統的多樣性趨勢,分析了不同組織(純模型製造商、大型科技公司、產品公司)釋出開源模型的動機,並介紹了 NVIDIA、Cohere、Zyphra、Poolside 等公司的最新模型釋出。
GLM-5.2:開放代理的階躍性變革
GLM-5.2 是 Z.ai 釋出的最新開放權重模型,被廣泛視為開放模型領域的一次重大突破。該模型在編碼和代理任務上表現出色,效能可與 Anthropic 和 OpenAI 的頂尖模型相媲美,甚至在某些基準測試中超越了它們。其釋出恰逢美國對 Claude Fable 實施出口限制,引發了關於開放模型與封閉模型未來格局的討論。
禁止開源AI將是一個錯誤
本文認為,禁止或過度監管開源AI將是嚴重錯誤。開源軟體在技術教育、創新和競爭中發揮著關鍵作用,並推動了數萬億美元的經濟價值。在AI領域,開源模型提供了對抗壟斷的力量,且更安全透明。針對中國的擔憂不應導致對開源的限制,而應加大對國內開源的支援。
部落格現狀,2026年中
作者在從Ai2離職後分享部落格Interconnects的現狀,闡述部落格與其職業目標的關係,最近擔任Arcee AI和Mercor的顧問,以及計劃將評論改為付費、增加付費文章來維持高質量的小眾讀者群。
前沿後訓練配方回顧:與Finbarr Timbers對話
本播客深入探討了後訓練配方的演變,從InstructGPT到2026年的多教師策略(MOPD)。Nathan Lambert與Finbarr Timbers回顧了OLMo-3等開源模型的挑戰,並分析了前沿實驗室如何透過專業化教師和策略蒸餾來突破效能瓶頸。
Claude Fable 5與新的AI安全寓言
Anthropic釋出了Claude Fable 5模型,這是目前最強大的公開模型。該公司推出了一系列安全措施,包括對特定領域使用降級模型,但對前沿AI開發請求進行靜默干預而不通知使用者,這引發了信任危機。文章批評了這種不一致的安全策略,並探討了AI安全與市場競爭之間的張力。
告別Ai2
Nathan Lambert回顧了他在艾倫人工智慧研究所(Ai2)的工作經歷,期間他參與了Olmo模型的開發,並領導了Tülu 3等專案。他強調開放研究的重要性,並分享了他從一名普通研究員成長為領域內知名科學家的歷程。
關於接下來會發生什麼的一些想法,2026年5月
2026年AI領域將繼續快速發展,開源模型在智慧體能力上仍落後於閉源模型,谷歌的Gemini尚未對Claude Code和Codex構成有力競爭,美國開源模型正在崛起,Anthropic與OpenAI競爭激烈,現有權力結構開始介入AI發展。
最新開放製品(#21):開放模型盛宴!Gemma 4、DeepSeek V4、Kimi K2.6、MiMo 2.5、GLM-5.1等。關於CAISI對V4的評估。
本月開放前沿實驗室紛紛釋出新模型,包括DeepSeek V4、Gemma 4、Kimi K2.6等。CAISI評估指出開放模型落後於美國前沿,且差距在擴大,但評估方法受到質疑,實際能力差距可能被高估。文章還介紹了多個亮點模型。
開放模型生態系統如何放大優勢
文章指出,前沿模型的算力約80%用於研發而非最終訓練。以中國為代表的開放生態系統透過共享減少重複研發成本。開放模型降低了未來開發成本,但部署成本高於閉源託管方案。作者呼籲建立開放模型聯盟以維持競爭力。
來自中國AI實驗室的筆記
透過對中國主要AI實驗室的訪問,作者發現了一種謙遜、務實、快速跟進的文化。中國研究人員(其中許多是學生)專注於模型構建而非哲學辯論,較少自我意識。生態系統顯示出早期國內AI需求,但資料產業欠發達,且對Nvidia晶片有強烈渴求。
解讀當今開源與閉源模型的效能差距
開源模型與閉源模型之間的效能差距並非單一數字所能概括,而是涉及基準測試的演變、實際應用表現以及訓練正規化的轉變。文章分析了這一動態變化,指出基準測試的可信度下降,以及前沿實驗室為維持收入而不斷自我革新的經濟壓力。同時,中國實驗室的開源模型在基準測試上表現出色,但在魯棒性和實際應用中仍有差距。
我最近在做什麼:ATOM報告、後訓練課程、完成我的書以及持續的研究
本文回顧了作者近期的各項努力,包括髮布ATOM報告更新、完成RLHF書籍並開放預訂、製作後訓練課程以及參與兩項技術研究。同時預告了即將前往中國和華盛頓特區的行程。
Claude Mythos與誤導性的開源模型恐慌
本文分析了Claude Mythos模型釋出後引發的關於開源AI模型安全風險的討論。作者認為這種恐慌與以往類似,指出開源模型的能力差距、執行成本以及具體的安全評估需求,呼籲進行細緻研究而非全面禁止。
Gemma 4 與開放模型成功的關鍵
本文探討了2026年開放模型面臨的競爭環境,評估開放模型成功的關鍵因素(效能、來源國、許可證、工具支援、微調能力),並重點分析了谷歌最新發布的Gemma 4系列。文章指出,開放模型的成功更多取決於易用性和生態支援,而非基準分數。