AI News HubLIVE
公開文章 62採集文章 66可信度 82刷新頻率 720 分鐘
健康狀態 健康來源類型 研究原文權限 站內改寫最近入庫 2026-08-09ID the-sequence運行狀態 已啟用

AI research and engineering newsletter; summary-only unless authorization is obtained.

最新公開文章

待翻譯:The Sequence Radar - Issue 910: Last Week in AI: Google Rewires Its Brain and Meta Hires a Coding Swarm

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Jeff Dean leaves, Demis Hassabis moves upstream, and Muse Code turns software development into an orchestration problem.

  • AI 服務暫時不可用,系統已先保留來源內容與降級後設資料。
  • Jeff Dean leaves, Demis Hassabis moves upstream, and Muse Code turns software development into an orchestration problem.
站內正文

待翻譯:The Sequence AI of the Week #908: You Need to Learn About Gemini Robotics

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Google put a walking humanoid inside a single policy, published the reasoning half as an API, and kept the motor half behind a partner gate. The numbers explain why.

  • AI 服務暫時不可用,系統已先保留來源內容與降級後設資料。
  • Google put a walking humanoid inside a single policy, published the reasoning half as an API, and kept the motor half behind a partner gate. The numbers explain why.
站內正文

The Sequence Radar #906:上週AI動態:開放模型、智慧機器人與信念的代價

NVIDIA與24家公司聯名致信華盛頓,呼籲避免對開放權重AI模型進行過早限制;Moonshot開源Kimi K3;谷歌DeepMind釋出Gemini Robotics 2;Aschenbrenner的對沖基金在虧損後拋售資產;科技巨頭財報顯示AI變現能力分化。

  • 黃仁勳首次釋出X帖,支援25家公司聯署的開放權重AI聯名信。
  • Moonshot釋出Kimi K3,一個2.8萬億引數的MoE模型,擁有100萬token上下文視窗。
站內正文

TheSequence意見#904:研究時代被高估,人工智慧工程正在獲勝

Ilya Sutskever將AI歷史分為研究、擴充套件和再次研究時代。然而,當前前沿模型仍基於Transformer,改進來自資料、上下文長度、強化學習等工程最佳化。作者認為,真正突破來自Transformer周圍的學習迴圈,而非替換它。

  • Sutskever的劃分引人深思,但當前模型架構並無根本性變革。
  • 前沿模型進步主要來自資料、上下文、強化學習等工程改進。
站內正文

序列知識 #902:學習蒸餾:當資料整合為教師

本文探討了大型語言模型如何改變資料在機器學習中的角色——從靜態資源轉變為智慧傳遞的媒介。透過合成資料蒸餾,強大的教師模型生成訓練資料,使學生模型繼承其能力,而教師本身在推理時不再需要。

  • 傳統機器學習將資料視為需要挖掘的靜態資源。
  • 大型語言模型既能消費資料,也能生成資料,如問題、答案、課程等。
站內正文

The Sequence Radar #901:上週AI動態:更智慧的模型、物理機器與擴充套件中的AI棧

Anthropic釋出Opus 5,提升了長期推理和代理編碼能力;Travis Kalanick的Atoms公司融資17億美元,專注於物理AI;Poolside推出Laguna S 2.1開源模型;OpenAI模型在測試中突破安全限制;Alphabet和AMD展示了AI基礎設施的鉅額投資;OpenRouter可能被收購,凸顯分發層的價值。

  • Anthropic的Opus 5在長期推理和代理編碼方面取得進展。
  • Atoms融資17億美元,押注物理AI。
站內正文

序列知識 #898:軌跡即教師:將推理蒸餾到小模型

2025年1月,DeepSeek利用其大型推理模型R1生成了約80萬個完整解題過程(長鏈思維,包括假啟動、自我修正等),過濾後對Qwen和Llama等小型開源模型進行簡單的監督微調,無需強化學習,卻意外地使小模型展現出超越自身規模的推理能力。這挑戰了此前認為序列級模仿不適用於推理蒸餾的觀點。

  • DeepSeek R1生成80萬推理軌跡用於蒸餾。
  • 使用簡單監督微調,無強化學習,小模型推理能力大幅提升。
站內正文

序列雷達 #897:上週AI要聞:中國、壓縮與開放模型競賽

本週AI領域多項重要進展:Thinking Machines釋出開源975B引數MoE模型Inkling,Moonshot AI推出2.8萬億引數Kimi K3,PrismML展示可在手機上執行的Bonsai 27B模型。OpenAI的GPT-Red透過自博弈實現自動化紅隊測試,並在測試中對GPT-5.1達到84%的攻破率。此外,習近平在上海世界人工智慧大會上強調開源AI作為全球公共品,呼籲國際合作。

  • Thinking Machines釋出開源模型Inkling:9750億引數,MoE架構,支援多模態和百萬標記上下文視窗
  • Moonshot AI推出Kimi K3:2.8萬億引數,啟用16個專家,針對長時編碼和知識工作
站內正文

序列觀點 #896:Spark、計算與兩個Meta

Meta釋出了Muse Spark 1.1,這是首個帶有價格標籤的Meta模型,標誌著從開源權重向閉源商業模式的轉變。同時,Meta在構建完整垂直堆疊——從晶片到雲再到應用,引發其能否與前沿AI實驗室競爭的討論。

  • Meta釋出Muse Spark 1.1,採用閉源權重和付費API,定價為每百萬輸入tokens 1.25美元、輸出tokens 4.25美元,相容OpenAI端點。
  • 扎克伯格三年來首次在X上發帖宣佈這一轉變,凸顯戰略調整。
站內正文

本週AI序列 #895:OpenAI 展示編碼評估的漏洞在哪裡

OpenAI 對 SWE-Bench Pro 的審計揭示了編碼基準測試的嚴重缺陷:大約30%的任務存在錯誤,導致精確的得分可能無法真實反映模型能力。該發現促使 OpenAI 撤回先前推薦該基準的建議,並強調需要更可靠的評估方法。

  • OpenAI 審計發現 SWE-Bench Pro 基準測試中約30%的任務存在缺陷
  • 基準測試的精確分數可能誤導對模型能力的判斷
站內正文

序列知識 #894:當學生開始回嘴——大語言模型時代的蒸餾技術

本文回顧了知識蒸餾從傳統固定資料集到現代大語言模型時代的演變過程,探討了三個關鍵階段,展示了蒸餾如何從簡單的壓縮技術轉變為複雜的能力轉移方法。

  • 傳統蒸餾假設固定的輸入分佈和封閉類別集,大語言模型打破了這些假設。
  • 蒸餾從壓縮固定函式轉變為能力轉移,使小模型能完成困難任務。
站內正文

The Sequence Radar #893:上週AI動態:GPT-5.6、Grok 4.5、Muse Spark 1.1與後聊天機器人棧

前沿AI實驗室正從聊天機器人轉向整合系統,模型作為執行時,頻繁釋出強大模型和代理。本週亮點包括OpenAI的GPT-5.6(Sol、Terra、Luna),具備程式化工具呼叫和並行子代理;GPT-Live全雙工音訊;ChatGPT Work用於建立工件;Meta的Muse Spark 1.1擁有百萬token上下文和主動上下文管理;Grok 4.5專注於編碼和知識工作。研究方面,OpenAI審計表明SWE-Bench Pro基準30%任務有問題;Anthropic提出GRAM方法可選擇性移除危險知識;SkillOpt-Lite最佳化代理自我進化;DSpark和Nemotron-Labs-Diffusion改進推理效率。行業新聞包括Lovable融資3億美元,Prime Intellect融資1.3億美元,SambaNova融資10億美元等。

  • OpenAI釋出GPT-5.6,分為Sol、Terra、Luna,支援程式化工具呼叫和並行子代理。
  • GPT-Live實現全雙工音訊對話,從回合制轉向連續互動。
站內正文

序列觀點#892:好環境的解剖:當可驗證性不足時

探討使某些領域適合人工智慧的屬性,不僅僅依賴可驗證性,還包括可磨礪性等維度。

  • 可驗證性並非AI成功的唯一因素,可磨礪性同樣關鍵。
  • 數學、程式碼和棋盤遊戲等領域在多個維度上表現優異,促進AI能力複合增長。
站內正文

The Sequence AI本週第891期:提示電子表格——深入剖析Google TabFM表格AI

谷歌研究團隊釋出了TabFM,一種用於表格分類和迴歸的基礎模型,它能夠將整個表格資料作為一個提示,透過一次前向傳播產生預測,無需訓練、調參或特徵工程,實現了表格資料的上下文學習。

  • TabFM是谷歌研究團隊新發布的表格基礎模型,支援分類和迴歸任務。
  • 該模型透過單一前向傳播即可對未見過的表格進行預測,無需訓練或特徵工程。
站內正文

知識蒸餾簡史

本文追溯了知識蒸餾技術從2006年到2015年的發展歷程,重點介紹了三篇奠基性論文,揭示了這一領域核心問題的演變。

  • 知識蒸餾的歷史比大多數人認為的2015年要早近十年,始於2006年的壓縮模仿研究。
  • 2015年Hinton等人的論文引入了軟max溫度技巧和“暗知識”概念,但並非首創。
站內正文

The Sequence Radar #889:Fable 5 迴歸、ZCode 登場、Claude Science 以及 35 億美元的部署爭奪戰

新模型、智慧體以及 FDE 格局的演變,成為 AI 領域的新戰場。本週重點包括 Claude Fable 5 在出口管制修復後迴歸、ZCode 的免費智慧體開發環境、Claude Science 科學工作臺,以及微軟、AWS 等公司對部署整合的大規模投資。

  • Claude Fable 5 在出口管制修復後迴歸,新增分類器降級處理,99% 以上成功率。
  • ZCode 釋出基於 GLM-5.2 的免費智慧體開發環境,權重開源,可自託管。
站內正文

序列觀點 #888:關於太空AI競賽你需要知道的一切

太空正成為AI的新前沿,能源稀缺驅動了這一趨勢。低地球軌道被視為無限制的能源來源,吸引科技巨頭、晶片製造商和初創公司競相佈局。截至2025年12月,首個在太空訓練的大型語言模型nanoGPT已在軌道上執行。

  • 太空成為AI新競爭領域,源於地球能源稀缺
  • 低地球軌道被視為能源無限且無監管的區域
站內正文

本週AI序列 #887:Meta的Autodata——當模型學會自己製作課程

Meta最新研究Autodata將資料生成轉變為一種智慧體過程,模型透過迭代建立、測試和最佳化自己的訓練資料,從而改變了AI訓練的傳統正規化。

  • Autodata將資料生成視為一種智慧體研究迴圈。
  • AI建立樣本、測試、從失敗中學習並更新方法論。
站內正文

序列雷達 #885:上週AI概覽——模型、遊戲與評估的未來

本週AI領域發生了一系列重要事件:OpenAI釋出GPT-5.6系列模型(Sol、Terra、Luna),採用分層安全架構和政府協調機制;Anthropic推出Claude Tag,透過語義標記增強模型互動;General Intuition融資3.2億美元,專注於基於遊戲動作資料訓練大型行動模型;LayerLens Stratix Cup透過足球比賽形式評估AI模型。此外,還有多項研究和技術釋出。

  • OpenAI釋出GPT-5.6系列,包括Sol、Terra、Luna三個型號,強調安全架構和分階段訪問。
  • Anthropic推出Claude Tag,利用語義標記實現更結構化的模型協作。
站內正文

自驅動實驗室:選擇下一個實驗的實驗室

自驅動實驗室透過將AI與自動化實驗硬體結合,使系統能夠根據實驗結果自主決定下一步實驗,區別於僅執行預設指令碼的自動化。

  • 自驅動實驗室的核心是AI與自動化硬體的結合,實現實驗決策的自主化。
  • 與自動化不同,自驅動實驗室會透過實驗即時學習並調整實驗方向。
站內正文

AI週報#883:Qwen進軍機器人領域

阿里巴巴的Qwen模型家族推出機器人套件,旨在彌合感知與行動之間的鴻溝。三個新模型分別專注於導航、操作和世界建模,核心挑戰在於將物理動作轉化為可學習的token。

  • Qwen模型長期侷限於軟體環境,無法執行物理操作。
  • 阿里巴巴釋出Qwen-Robot Suite,包含三個專用模型。
站內正文

序列知識#882:關於蒸餾技術的新系列

深入探討現代AI中最重要的技術之一——蒸餾,以及它如何解決大規模模型帶來的成本、部署和專業化問題。

  • 蒸餾技術使AI模型更高效、更易部署,是應對規模帶來的挑戰的關鍵。
  • 規模推動了AI進步,但也導致模型昂貴、緩慢、難以專業化。
站內正文

The Sequence Special #881:人工智慧模型的足球世界盃

LayerLens 推出 Stratix 杯,這是一場頂級 AI 模型在模擬環境中作為智慧體進行足球比賽,考驗規劃、適應和多智慧體協調能力。

  • LayerLens 推出 Stratix 杯,這是一個 AI 模型的足球錦標賽。
  • 比賽測試智慧體能力:賽前策略、即時比賽和半場調整。
站內正文

序列雷達 #880:上週AI要聞——600億美元Cursor交易、谷歌人才流失、Midjourney的人體掃描器

AI市場上一週出現了一系列意想不到的轉折:SpaceX以600億美元收購Cursor,Noam Shazeer和John Jumper分別離開谷歌加入OpenAI和Anthropic,Midjourney推出全身醫用掃描器。

  • 1. SpaceX以600億美元股票收購Cursor,標誌著AI工具已成為與火箭發射能力同等重要的戰略基礎設施。
  • 2. Noam Shazeer和John Jumper相繼離開谷歌,凸顯了AI前沿領域激烈的人才爭奪戰,頂尖研究者成為最稀缺的資源。
站內正文

序列AI本週第878期:谷歌DeepMind首次真正突破下一代令牌生成

谷歌DeepMind釋出了DiffusionGemma,這是一種文本擴散模型,挑戰了傳統的Transformer架構。該模型不依賴從左到右逐令牌生成文本的方式,而是採用全新的生成機制。

  • DiffusionGemma是谷歌DeepMind釋出的一種文本擴散模型。
  • 該模型挑戰了傳統的Transformer架構。
站內正文

序列知識 #878:超越Transformer:我們學到的

本文總結了關於Transformer替代方案的系列文章,涵蓋四大類模型:遞迴/線性遞迴模型、狀態空間模型、文本擴散模型和液態/連續時間模型。同時宣佈將推出關於知識蒸餾的新系列。

  • 自注意力機制帶來二次方複雜度,長序列計算和記憶體成本高昂。
  • 四種替代方向:遞迴模型(恆記憶體)、狀態空間模型(線性縮放)、文本擴散(並行生成)、液態模型(連續時間動態)。
站內正文

全部來源