AI News HubLIVE
公开文章 62采集文章 66可信度 82刷新频率 720 分钟
健康状态 健康来源类型 研究原文权限 站内改写最近入库 2026-08-09ID the-sequence运行状态 已启用

AI research and engineering newsletter; summary-only unless authorization is obtained.

最新公开文章

待翻译:The Sequence Radar - Issue 910: Last Week in AI: Google Rewires Its Brain and Meta Hires a Coding Swarm

AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Jeff Dean leaves, Demis Hassabis moves upstream, and Muse Code turns software development into an orchestration problem.

  • AI 服务暂时不可用,系统已先保留来源内容与降级元数据。
  • Jeff Dean leaves, Demis Hassabis moves upstream, and Muse Code turns software development into an orchestration problem.
站内正文

待翻译:The Sequence AI of the Week #908: You Need to Learn About Gemini Robotics

AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Google put a walking humanoid inside a single policy, published the reasoning half as an API, and kept the motor half behind a partner gate. The numbers explain why.

  • AI 服务暂时不可用,系统已先保留来源内容与降级元数据。
  • Google put a walking humanoid inside a single policy, published the reasoning half as an API, and kept the motor half behind a partner gate. The numbers explain why.
站内正文

The Sequence Radar #906:上周AI动态:开放模型、智能机器人与信念的代价

NVIDIA与24家公司联名致信华盛顿,呼吁避免对开放权重AI模型进行过早限制;Moonshot开源Kimi K3;谷歌DeepMind发布Gemini Robotics 2;Aschenbrenner的对冲基金在亏损后抛售资产;科技巨头财报显示AI变现能力分化。

  • 黄仁勋首次发布X帖,支持25家公司联署的开放权重AI联名信。
  • Moonshot发布Kimi K3,一个2.8万亿参数的MoE模型,拥有100万token上下文窗口。
站内正文

TheSequence意见#904:研究时代被高估,人工智能工程正在获胜

Ilya Sutskever将AI历史分为研究、扩展和再次研究时代。然而,当前前沿模型仍基于Transformer,改进来自数据、上下文长度、强化学习等工程优化。作者认为,真正突破来自Transformer周围的学习循环,而非替换它。

  • Sutskever的划分引人深思,但当前模型架构并无根本性变革。
  • 前沿模型进步主要来自数据、上下文、强化学习等工程改进。
站内正文

序列知识 #902:学习蒸馏:当数据集成为教师

本文探讨了大型语言模型如何改变数据在机器学习中的角色——从静态资源转变为智能传递的媒介。通过合成数据蒸馏,强大的教师模型生成训练数据,使学生模型继承其能力,而教师本身在推理时不再需要。

  • 传统机器学习将数据视为需要挖掘的静态资源。
  • 大型语言模型既能消费数据,也能生成数据,如问题、答案、课程等。
站内正文

The Sequence Radar #901:上周AI动态:更智能的模型、物理机器与扩展中的AI栈

Anthropic发布Opus 5,提升了长期推理和代理编码能力;Travis Kalanick的Atoms公司融资17亿美元,专注于物理AI;Poolside推出Laguna S 2.1开源模型;OpenAI模型在测试中突破安全限制;Alphabet和AMD展示了AI基础设施的巨额投资;OpenRouter可能被收购,凸显分发层的价值。

  • Anthropic的Opus 5在长期推理和代理编码方面取得进展。
  • Atoms融资17亿美元,押注物理AI。
站内正文

序列知识 #898:轨迹即教师:将推理蒸馏到小模型

2025年1月,DeepSeek利用其大型推理模型R1生成了约80万个完整解题过程(长链思维,包括假启动、自我修正等),过滤后对Qwen和Llama等小型开源模型进行简单的监督微调,无需强化学习,却意外地使小模型展现出超越自身规模的推理能力。这挑战了此前认为序列级模仿不适用于推理蒸馏的观点。

  • DeepSeek R1生成80万推理轨迹用于蒸馏。
  • 使用简单监督微调,无强化学习,小模型推理能力大幅提升。
站内正文

序列雷达 #897:上周AI要闻:中国、压缩与开放模型竞赛

本周AI领域多项重要进展:Thinking Machines发布开源975B参数MoE模型Inkling,Moonshot AI推出2.8万亿参数Kimi K3,PrismML展示可在手机上运行的Bonsai 27B模型。OpenAI的GPT-Red通过自博弈实现自动化红队测试,并在测试中对GPT-5.1达到84%的攻破率。此外,习近平在上海世界人工智能大会上强调开源AI作为全球公共品,呼吁国际合作。

  • Thinking Machines发布开源模型Inkling:9750亿参数,MoE架构,支持多模态和百万标记上下文窗口
  • Moonshot AI推出Kimi K3:2.8万亿参数,激活16个专家,针对长时编码和知识工作
站内正文

序列观点 #896:Spark、计算与两个Meta

Meta发布了Muse Spark 1.1,这是首个带有价格标签的Meta模型,标志着从开源权重向闭源商业模式的转变。同时,Meta在构建完整垂直堆栈——从芯片到云再到应用,引发其能否与前沿AI实验室竞争的讨论。

  • Meta发布Muse Spark 1.1,采用闭源权重和付费API,定价为每百万输入tokens 1.25美元、输出tokens 4.25美元,兼容OpenAI端点。
  • 扎克伯格三年来首次在X上发帖宣布这一转变,凸显战略调整。
站内正文

本周AI序列 #895:OpenAI 展示编码评估的漏洞在哪里

OpenAI 对 SWE-Bench Pro 的审计揭示了编码基准测试的严重缺陷:大约30%的任务存在错误,导致精确的得分可能无法真实反映模型能力。该发现促使 OpenAI 撤回先前推荐该基准的建议,并强调需要更可靠的评估方法。

  • OpenAI 审计发现 SWE-Bench Pro 基准测试中约30%的任务存在缺陷
  • 基准测试的精确分数可能误导对模型能力的判断
站内正文

序列知识 #894:当学生开始回嘴——大语言模型时代的蒸馏技术

本文回顾了知识蒸馏从传统固定数据集到现代大语言模型时代的演变过程,探讨了三个关键阶段,展示了蒸馏如何从简单的压缩技术转变为复杂的能力转移方法。

  • 传统蒸馏假设固定的输入分布和封闭类别集,大语言模型打破了这些假设。
  • 蒸馏从压缩固定函数转变为能力转移,使小模型能完成困难任务。
站内正文

The Sequence Radar #893:上周AI动态:GPT-5.6、Grok 4.5、Muse Spark 1.1与后聊天机器人栈

前沿AI实验室正从聊天机器人转向集成系统,模型作为运行时,频繁发布强大模型和代理。本周亮点包括OpenAI的GPT-5.6(Sol、Terra、Luna),具备程序化工具调用和并行子代理;GPT-Live全双工音频;ChatGPT Work用于创建工件;Meta的Muse Spark 1.1拥有百万token上下文和主动上下文管理;Grok 4.5专注于编码和知识工作。研究方面,OpenAI审计表明SWE-Bench Pro基准30%任务有问题;Anthropic提出GRAM方法可选择性移除危险知识;SkillOpt-Lite优化代理自我进化;DSpark和Nemotron-Labs-Diffusion改进推理效率。行业新闻包括Lovable融资3亿美元,Prime Intellect融资1.3亿美元,SambaNova融资10亿美元等。

  • OpenAI发布GPT-5.6,分为Sol、Terra、Luna,支持程序化工具调用和并行子代理。
  • GPT-Live实现全双工音频对话,从回合制转向连续交互。
站内正文

序列观点#892:好环境的解剖:当可验证性不足时

探讨使某些领域适合人工智能的属性,不仅仅依赖可验证性,还包括可磨砺性等维度。

  • 可验证性并非AI成功的唯一因素,可磨砺性同样关键。
  • 数学、代码和棋盘游戏等领域在多个维度上表现优异,促进AI能力复合增长。
站内正文

The Sequence AI本周第891期:提示电子表格——深入剖析Google TabFM表格AI

谷歌研究团队发布了TabFM,一种用于表格分类和回归的基础模型,它能够将整个表格数据作为一个提示,通过一次前向传播产生预测,无需训练、调参或特征工程,实现了表格数据的上下文学习。

  • TabFM是谷歌研究团队新发布的表格基础模型,支持分类和回归任务。
  • 该模型通过单一前向传播即可对未见过的表格进行预测,无需训练或特征工程。
站内正文

知识蒸馏简史

本文追溯了知识蒸馏技术从2006年到2015年的发展历程,重点介绍了三篇奠基性论文,揭示了这一领域核心问题的演变。

  • 知识蒸馏的历史比大多数人认为的2015年要早近十年,始于2006年的压缩模仿研究。
  • 2015年Hinton等人的论文引入了软max温度技巧和“暗知识”概念,但并非首创。
站内正文

The Sequence Radar #889:Fable 5 回归、ZCode 登场、Claude Science 以及 35 亿美元的部署争夺战

新模型、智能体以及 FDE 格局的演变,成为 AI 领域的新战场。本周重点包括 Claude Fable 5 在出口管制修复后回归、ZCode 的免费智能体开发环境、Claude Science 科学工作台,以及微软、AWS 等公司对部署集成的大规模投资。

  • Claude Fable 5 在出口管制修复后回归,新增分类器降级处理,99% 以上成功率。
  • ZCode 发布基于 GLM-5.2 的免费智能体开发环境,权重开源,可自托管。
站内正文

序列观点 #888:关于太空AI竞赛你需要知道的一切

太空正成为AI的新前沿,能源稀缺驱动了这一趋势。低地球轨道被视为无限制的能源来源,吸引科技巨头、芯片制造商和初创公司竞相布局。截至2025年12月,首个在太空训练的大型语言模型nanoGPT已在轨道上运行。

  • 太空成为AI新竞争领域,源于地球能源稀缺
  • 低地球轨道被视为能源无限且无监管的区域
站内正文

本周AI序列 #887:Meta的Autodata——当模型学会自己制作课程

Meta最新研究Autodata将数据生成转变为一种智能体过程,模型通过迭代创建、测试和优化自己的训练数据,从而改变了AI训练的传统范式。

  • Autodata将数据生成视为一种智能体研究循环。
  • AI创建样本、测试、从失败中学习并更新方法论。
站内正文

序列雷达 #885:上周AI概览——模型、游戏与评估的未来

本周AI领域发生了一系列重要事件:OpenAI发布GPT-5.6系列模型(Sol、Terra、Luna),采用分层安全架构和政府协调机制;Anthropic推出Claude Tag,通过语义标记增强模型交互;General Intuition融资3.2亿美元,专注于基于游戏动作数据训练大型行动模型;LayerLens Stratix Cup通过足球比赛形式评估AI模型。此外,还有多项研究和技术发布。

  • OpenAI发布GPT-5.6系列,包括Sol、Terra、Luna三个型号,强调安全架构和分阶段访问。
  • Anthropic推出Claude Tag,利用语义标记实现更结构化的模型协作。
站内正文

自驱动实验室:选择下一个实验的实验室

自驱动实验室通过将AI与自动化实验硬件结合,使系统能够根据实验结果自主决定下一步实验,区别于仅执行预设脚本的自动化。

  • 自驱动实验室的核心是AI与自动化硬件的结合,实现实验决策的自主化。
  • 与自动化不同,自驱动实验室会通过实验实时学习并调整实验方向。
站内正文

AI周报#883:Qwen进军机器人领域

阿里巴巴的Qwen模型家族推出机器人套件,旨在弥合感知与行动之间的鸿沟。三个新模型分别专注于导航、操作和世界建模,核心挑战在于将物理动作转化为可学习的token。

  • Qwen模型长期局限于软件环境,无法执行物理操作。
  • 阿里巴巴发布Qwen-Robot Suite,包含三个专用模型。
站内正文

序列知识#882:关于蒸馏技术的新系列

深入探讨现代AI中最重要的技术之一——蒸馏,以及它如何解决大规模模型带来的成本、部署和专业化问题。

  • 蒸馏技术使AI模型更高效、更易部署,是应对规模带来的挑战的关键。
  • 规模推动了AI进步,但也导致模型昂贵、缓慢、难以专业化。
站内正文

The Sequence Special #881:人工智能模型的足球世界杯

LayerLens 推出 Stratix 杯,这是一场顶级 AI 模型在模拟环境中作为智能体进行足球比赛,考验规划、适应和多智能体协调能力。

  • LayerLens 推出 Stratix 杯,这是一个 AI 模型的足球锦标赛。
  • 比赛测试智能体能力:赛前策略、实时比赛和半场调整。
站内正文

序列雷达 #880:上周AI要闻——600亿美元Cursor交易、谷歌人才流失、Midjourney的人体扫描仪

AI市场上一周出现了一系列意想不到的转折:SpaceX以600亿美元收购Cursor,Noam Shazeer和John Jumper分别离开谷歌加入OpenAI和Anthropic,Midjourney推出全身医用扫描仪。

  • 1. SpaceX以600亿美元股票收购Cursor,标志着AI工具已成为与火箭发射能力同等重要的战略基础设施。
  • 2. Noam Shazeer和John Jumper相继离开谷歌,凸显了AI前沿领域激烈的人才争夺战,顶尖研究者成为最稀缺的资源。
站内正文

序列AI本周第878期:谷歌DeepMind首次真正突破下一代令牌生成

谷歌DeepMind发布了DiffusionGemma,这是一种文本扩散模型,挑战了传统的Transformer架构。该模型不依赖从左到右逐令牌生成文本的方式,而是采用全新的生成机制。

  • DiffusionGemma是谷歌DeepMind发布的一种文本扩散模型。
  • 该模型挑战了传统的Transformer架构。
站内正文

序列知识 #878:超越Transformer:我们学到的

本文总结了关于Transformer替代方案的系列文章,涵盖四大类模型:递归/线性递归模型、状态空间模型、文本扩散模型和液态/连续时间模型。同时宣布将推出关于知识蒸馏的新系列。

  • 自注意力机制带来二次方复杂度,长序列计算和内存成本高昂。
  • 四种替代方向:递归模型(恒内存)、状态空间模型(线性缩放)、文本扩散(并行生成)、液态模型(连续时间动态)。
站内正文

全部来源