AI News HubLIVE
公開文章 76採集文章 84可信度 90刷新頻率 30 分鐘
健康狀態 健康來源類型 研究原文權限 官方原文最近入庫 2026-08-07ID apple-ml-research運行狀態 已啟用

Official research source; confirm reuse terms before enabling full body display.

最新公開文章

待翻譯:Arbitrage: Efficient Reasoning via Advantage-Aware Speculation

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Modern Large Language Models achieve impressive reasoning capabilities with long Chain of Thoughts, but they incur substantial computational cost during inference, and this motivates techniques to improve the performance-cost ratio. Among these techniques, Speculative Decoding accelerates inference by employing a fast but inaccurate draft model to auto-regressively propose tokens, which are then verified in parallel by a more capable target model. However, due to unnecessary rejections caused by token mismatches in semantically equivalent steps, traditional token-level Speculative Decoding…

  • AI 服務暫時不可用,系統已先保留來源內容與降級元數據。
  • Modern Large Language Models achieve impressive reasoning capabilities with long Chain of Thoughts, but they incur substantial computational cost during inference, and this motiva…
站內正文

待翻譯:Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Large Language Models (LLMs) have achieved state-of-the-art performance on a broad range of Natural Language Processing (NLP) tasks, including document processing and code generation. Autoregressive Language Models (ARMs), which generate tokens sequentially conditioned on all previous tokens, have been the predominant paradigm for LLMs. While these models have achieved high accuracy across a range of downstream tasks, they exhibit low arithmetic intensity due to the inherent sequential dependency in next-token prediction. Recently, Diffusion Language Models (DLMs) have emerged as a promising…

  • AI 服務暫時不可用,系統已先保留來源內容與降級元數據。
  • Large Language Models (LLMs) have achieved state-of-the-art performance on a broad range of Natural Language Processing (NLP) tasks, including document processing and code generat…
站內正文

待翻譯:Scaling Categorical Flow Maps

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Continuous diffusion and flow matching models could represent a powerful alternative to autoregressive approaches for language modelling (LM), as they unlock a host of advantages currently reserved for continuous modalities, including accelerated sampling and tilting. Recently, several works have demonstrated the possibility of generating discrete data continuously by a simple flow matching process between a Gaussian and the one-hot encoded data distribution. They have further shown the feasibility of accelerated sampling via Categorical Flow Maps (CFMs), resulting in competitive sample…

  • AI 服務暫時不可用,系統已先保留來源內容與降級元數據。
  • Continuous diffusion and flow matching models could represent a powerful alternative to autoregressive approaches for language modelling (LM), as they unlock a host of advantages…
站內正文

待翻譯:DeepAmbigQA: Ambiguous Multi-hop Questions for Benchmarking LLM Answer Completeness

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Large language models (LLMs) with integrated search tools show strong promise in open-domain question answering (QA), yet they often struggle to produce complete answer set to complex questions such as “Which actor from the film Heat won at least one Academy Award?”, which requires (1) distinguishing between multiple films sharing the same title and (2) reasoning across a large set of actors to gather and integrate evidence. Existing QA benchmarks rarely evaluate both challenges jointly. To address this, we introduce DEEPAMBIGQAGEN, an automatic data generation pipeline that constructs QA…

  • AI 服務暫時不可用,系統已先保留來源內容與降級元數據。
  • Large language models (LLMs) with integrated search tools show strong promise in open-domain question answering (QA), yet they often struggle to produce complete answer set to com…
站內正文

待翻譯:Locking Pretrained Weights via Deep Low-Rank Residual Distillation

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:The quality of open-weight language models has dramatically improved in recent years. Sharing weights greatly facilitates model adoption by enabling their use across diverse hardware and software platforms. They also allow for more open research and testing, to the extent that users can use them as checkpoints, fine-tune them according to their needs, and potentially redistribute them. In some cases, however, concerns on modifying these weights towards unauthorized uses may outweigh the pros of giving users such a freedom. Defending against such adaptation is non-trivial: since an adaptive…

  • AI 服務暫時不可用,系統已先保留來源內容與降級元數據。
  • The quality of open-weight language models has dramatically improved in recent years. Sharing weights greatly facilitates model adoption by enabling their use across diverse hardw…
站內正文

待翻譯:Taming Outlier Tokens in Diffusion Transformers

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:We study outlier tokens in Diffusion Transformers (DiTs) for image generation. Prior work has shown that Vision Transformers (ViTs) can produce a small number of high-norm tokens that attract disproportionate attention while carrying limited local information, but their role in generative models remains underexplored. We show that this phenomenon appears in both the encoder and denoiser of modern Representation Autoencoder (RAE)-DiT pipelines: pretrained ViT encoders can produce outlier representations, and DiTs themselves can develop internal outlier tokens, especially in intermediate layers…

  • AI 服務暫時不可用,系統已先保留來源內容與降級元數據。
  • We study outlier tokens in Diffusion Transformers (DiTs) for image generation. Prior work has shown that Vision Transformers (ViTs) can produce a small number of high-norm tokens…
站內正文

待翻譯:Understanding Alignment in Multimodal LLMs: A Comprehensive Study

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Preference alignment has become a crucial component in enhancing the performance of Large Language Models (LLMs), yet its impact in Multimodal Large Language Models (MLLMs) remains comparatively underexplored. Similar to language models, MLLMs for image understanding tasks encounter challenges like hallucination. In MLLMs, hallucination can occur not only by stating incorrect facts but also by producing responses that are inconsistent with the image content. A primary objective of alignment for MLLMs is to encourage these models to align responses more closely with image information. Recently…

  • AI 服務暫時不可用,系統已先保留來源內容與降級元數據。
  • Preference alignment has become a crucial component in enhancing the performance of Large Language Models (LLMs), yet its impact in Multimodal Large Language Models (MLLMs) remain…
站內正文

MoMo:通過時空動作標記化實現機器人操作中的運動模式調節

機器人需根據任務、物體和交互環境調整操作方式,而不僅限於精確執行。本文提出MoMo,一個兩階段模仿學習框架,包含時空動作標記器和行為克隆Transformer,可輸入連續的運動模式條件。在六個真實機器人操作任務中,改變該條件可產生穩定、動態及中間行為,且人類評估者能夠區分。在僅演示一種模式的任務上,MoMo能轉移未見過的請求模式,同時基本保持任務成功率,展示了任務-模式組合的泛化能力。

  • MoMo框架通過時空動作標記化將執行層面的變化作為可複用行為因素進行學習。
  • 連續運動模式條件可在六個真實任務中產生穩定、動態等不同行為。
站內正文

降維與網絡科學的融合:基於UMAP kNN圖的數據理解

UMAP廣泛用於高維數據探索,但典型工作只關注其低維嵌入,忽略了內部構建的k近鄰(kNN)圖。該圖在原始高維空間編碼數據流形,避免了2D投影的失真。本文展示了這一內部表示的潛力:通過應用PageRank、k-core分解和聚類係數等標準圖算法,可以增強數據理解。在MNIST和Fashion MNIST上的評估表明,這些基於圖的分析不僅實用,而且與專用方法(如k-medoids、HDBSCAN)相比具有競爭力或互補性。

  • UMAP的kNN圖在二維嵌入失真前保留了高維流形結構。
  • 將PageRank、k-core分解和聚類係數等圖算法應用於該圖,實現新的數據探索能力。
站內正文

基於解耦時間深度擴散變換器的內存高效音頻合成

Apple 發佈了 Siri Expressive Voices,其背後是名為“去分詞器”的內存高效音頻合成架構。該架構將基礎模型發出的語義音頻令牌轉換為高保真音頻,在 Apple Matrix 協處理器(AMX)的嚴格計算和內存預算內運行。它採用三組件設計:流式編碼器、時間解碼器和深度解碼器,系統性地解耦時間和深度處理。單個可重複使用的深度解碼器利用擴散變換器(DiT)風格的階段條件生成所有 RVQ 層級,取代了先前多解碼器架構中專用的逐層解碼器。因果滑動窗口注意力與固定窗口鍵值緩存使內存複雜度與序列長度無關。在 AMX 上部署時,去分詞器每個生成步驟約需 10ms(比實時快約 16 倍),峯值運行時內存約 21MB,設備端資產 329MB,可在設備端基礎模型旁連續流式合成 20-320 秒的音頻。該架構已部署在 Siri Expressive Voices 中,在 AFM 3 Core Advanced(10 億參數激活規模)下運行,平均意見得分(MOS)比之前的設備端文本轉語音系統整體提升 0.28(4.15 vs. 3.87),在對話語音上提升 0.42(4.24 vs. 3.82)。

  • Apple 發佈 Siri Expressive Voices,採用新的去分詞器架構實現內存高效的設備端音頻合成。
  • 該架構解耦時間和深度處理,使用單個深度解碼器生成所有 RVQ 層級,內存佔用恆定。
站內正文

GH-ESD:面向實例級視覺任務的基於假設的誤差切片發現方法

GH-ESD是一種新穎的誤差切片發現框架,專門針對實例級視覺任務(如目標檢測和分割)設計。它通過生成與驗證範式,利用大語言模型先驗和視覺語言模型在實例級發現假設切片,並統計驗證,從而識別出由於上下文關係和空間模式導致的系統失敗。實驗表明,該方法在GESD基準上顯著優於現有基線。

  • 現有切片發現方法主要適用於圖像級分類,難以捕獲實例級任務中由上下文關係和空間模式導致的失敗。
  • GH-ESD採用生成-驗證框架,結合LLM先驗和視覺語言模型在實例級生成並驗證假設切片。
站內正文

LEAD:突破長程推理中的不可恢復瓶頸

大型語言模型在執行長程任務時即使有高級策略也會出現不穩定。研究發現,雖然分解對穩定性至關重要,但過度分解會導致“不可恢復瓶頸”,即在少數“困難”步驟上的一致錯誤變得不可逆轉。為此,提出了前瞻增強原子分解(LEAD),通過結合短期未來驗證和聚合重疊樣本來提供足夠的隔離和局部上下文,從而糾正錯誤。該方法使o4-mini模型在Checkers Jumping問題中解決了n=13的複雜度,而極端分解在n=11時就失敗。

  • 長程執行在LLM中仍然不穩定,即使提供了高級策略。
  • 極端分解會創建“不可恢復瓶頸”,使得在少數困難步驟上的錯誤不可逆。
站內正文

利用校準稀疏注意力加速文本到視頻生成

本文提出CalibAtt,一種無需訓練的稀疏注意力方法,通過離線校準識別穩定的稀疏模式,在推理時跳過不重要連接,實現最高1.58倍端到端加速,且不降低視頻生成質量。

  • 發現大量token連接分數可忽略且模式重複,可跳過計算
  • CalibAtt離線校準並編譯稀疏模式到優化注意力操作
站內正文

無環境合成數據生成:為API調用智能體訓練

蘋果研究團隊提出一種無需真實環境的合成數據生成方法,利用LLM作為數字世界模型,僅通過API規範生成高質量軌跡。在AppWorld和OfficeBench上微調模型取得顯著性能提升,為API智能體訓練提供了可擴展的解決方案。

  • 傳統方法依賴完整的執行環境,限制數據規模
  • 新方法使用LLM模擬API響應生成軌跡
站內正文

長度價值模型:面向令牌級長度建模的可擴展價值預訓練

蘋果研究人員提出長度價值模型(LenVM),一種在解碼每一步預測剩餘生成長度的令牌級框架。通過將長度建模轉化為價值估計問題,並賦予每個生成令牌恆定負獎勵,LenVM實現了無標註、密集、無偏且可擴展的監督。在LLM和VLM上的實驗顯示,在LIFEBench精確長度匹配任務中,LenVM將7B模型的長度分數從30.9提升至64.8,超越前沿閉源模型。此外,LenVM支持長度控制、預測和生成動態解釋。

  • LenVM是令牌級框架,預測每一步的剩餘生成長度。
  • 通過價值估計和恆定負獎勵實現無標註監督。
站內正文

LVSum:時間戳感知的長視頻摘要基準

LVSum是一個人工標註的基準,用於評估多模態大模型在長視頻摘要中的時間對齊能力。包含72個視頻,平均時長16分鐘,每個視頻有最多10個人工生成的含時間參考的摘要。研究發現,轉錄文本比視覺幀貢獻更大,模型與人工摘要差距顯著,且MLLMs在時間定位、指令遵循和跨模態一致性方面存在系統性弱點。

  • 引入LVSum基準,包含72個跨領域長視頻,帶細粒度時間對齊的人工摘要。
  • 轉錄文本對摘要質量的貢獻遠超視覺幀。
站內正文

示例説明:從圖像集中推斷視覺概念

視覺語言模型(VLM)能夠遵循複雜的文本指令,但難以僅從視覺上下文中進行推理。新提出的視覺概念推斷任務(VICIS)評估了這一能力。作者提出了一個訓練框架和架構,學習從圖像集中提取概念特定嵌入,從而提升生成準確性和對未見概念及模態的泛化能力。

  • VLM無法從純視覺上下文集中推斷概念,容易產生有偏見的生成。
  • VICIS任務測試將上下文定義的概念應用於新查詢圖像的能力。
站內正文

當遺忘是免費的:利用低影響力數據點降低計算成本

一篇新論文挑戰了機器學習中遺忘(unlearning)的標準方法,提出並非所有需要遺忘的數據點都需同等對待。通過分析影響函數,研究者識別出對模型輸出影響可忽略的訓練數據子集,並在遺忘前縮減數據集規模,實際示例中實現約50%的計算節省。

  • 現有遺忘方法平等對待所有遺忘點,但部分點對模型影響極小
  • 利用影響函數識別低影響點,可安全跳過這些點的遺忘操作
站內正文

令人驚訝的簡單自蒸餾方法提升代碼生成能力

蘋果研究人員提出簡單自蒸餾(SSD)方法,僅利用模型自身的輸出進行微調,無需驗證器、教師模型或強化學習,顯著提升了代碼生成性能,在LiveCodeBench v6上將Qwen3-30B-Instruct的pass@1從42.4%提高到55.3%。

  • SSD通過採樣自身輸出並進行標準監督微調來改進模型
  • 在LiveCodeBench v6上提升了13個百分點,尤其對難題效果顯著
站內正文

混合文本與ID嵌入的個性化增量視頻搜索

本文提出了一種針對Apple TV搜索的個性化系統,結合文本嵌入和ID協作嵌入,通過對比學習和交互數據學習物品表徵。在運行時,利用用户歷史構建表徵並注入XGBoost排名器。離線實驗顯示,在模糊前綴查詢上NDCG@10提升8.63%,長曆史用户獲益更大。在線實驗獲得點擊率+1.14%和轉化率+1.23%的顯著提升。

  • 提出融合文本多語言編碼器與ID協作嵌入的混合方法
  • 在模糊短查詢(1-3字符)上NDCG@10提升8.63%
站內正文

雙亞線性交互式接近性證明

本文研究雙亞線性交互式接近性證明(dsIPPs),這是一種超快速生成和驗證的證明系統,可用於證明關於海量輸入的近似斷言。證明者只需讀取輸入的一小部分(亞線性),而驗證者讀取的部分更少。作者為任意可由常寬度一次性無記憶分支程序(ROOBP)決定的屬性構造了此類系統,還構建了針對輸入漢明重量近似驗證以及有界度圖模型中二分性鬆弛的證明系統。

  • dsIPP允許證明者在亞線性時間內生成證明,驗證者所需時間更少。
  • 為ROOBP可判定的屬性構造了通用的dsIPP。
站內正文

大語言模型函數調用的不確定性量化

首次評估了LLM函數調用中的不確定性量化方法,發現多采樣方法不優於單採樣方法,並提出基於抽象語法樹聚類和語義標記選擇的改進策略。

  • 首次評估LLM函數調用場景下的不確定性量化方法
  • 多采樣UQ方法(如語義熵)在函數調用中無顯著優勢
站內正文

CLaRa:通過連續潛在推理連接檢索與生成

CLaRa是一種統一的檢索增強生成框架,通過將文檔壓縮為連續向量並端到端聯合優化重排序器和生成器,顯著減少了上下文長度,提高了問答性能。其關鍵創新包括基於問答和釋義的SCP數據合成以及可微分的top-k估計器,實現了高達16倍的壓縮率,超越了基於文本的基線方法。

  • CLaRa使用嵌入壓縮將文檔縮短為連續向量,減少輸入生成器的長度。
  • 引入SCP框架,通過問答和釋義監督生成保留關鍵信息的壓縮表示。
站內正文

單層足矣:適配預訓練視覺編碼器用於圖像生成

提出FAE(特徵自編碼器)框架,僅用單個注意力層即可將預訓練視覺表示適配為低維生成潛空間,在ImageNet 256×256上達到接近SOTA的FID 1.29(含CFG)和1.48(無CFG),兼顧重建與理解信息。

  • FAE通過兩個獨立解碼器耦合,分別用於重建原始特徵空間和圖像生成,僅需單層注意力。
  • 兼容多種自監督編碼器(如DINO、SigLIP)和生成模型(擴散模型、歸一化流)。
站內正文

Apple Music搜索的多語言語義檢索系統

Apple Music為150多個地區、數十種語言的用户提供服務,每天新增數十萬首曲目。針對拼寫錯誤、音譯和跨語言查詢的搜索召回率成為影響用户體驗的關鍵。蘋果研究人員提出了一種基於3.05億參數Siamese雙編碼器的多語言語義檢索系統,通過混合檢索架構與現有索引結合,實現了69%的Hit@10相對改進,在線A/B測試中整體轉化率提升2.28%,無結果率降低86%,長尾查詢轉化率提升7.93%。

  • Apple Music推出多語言語義檢索系統,基於GTE-multilingual-base微調的3.05億參數Siamese雙編碼器。
  • 採用混合檢索架構,結合密集向量和基於令牌的索引,無需重新訓練下游排序器。
站內正文

主動代理研究環境:模擬活躍用户以評估主動助手

研究人員提出了Pare框架,通過有限狀態機建模應用程序,實現對主動代理在數字環境中的真實用户仿真,併發布了包含143個任務的Pare-Bench基準測試。

  • 現有方法將應用建模為平面工具調用API,無法捕捉用户交互的狀態性和順序性。
  • Pare框架將應用建模為具有狀態導航和狀態相關動作空間的有限狀態機。
站內正文

行為隱私泄露:代理協商中的推理攻擊形式化與隨機策略緩解

該論文被ARES 2026的AI4TCI研討會接收。研究關注自主協商代理在高風險場景(如保險和採購)中的行為隱私泄露問題。作者設計了一種自適應隨機協商策略,在保證(ε,δ)-差分隱私和幾乎必然收斂的同時,將對手推理準確性降低43-50%,並將協商成功率和效用維持在90%以上。

  • 針對協商代理的行為隱私泄露,形式化推理攻擊並設計隨機化防禦策略
  • 基於差分隱私的自適應策略保證幾乎必然收斂
站內正文

揭秘在線策略蒸餾:何時有益,何時有害,以及原因

儘管在線策略蒸餾為訓練推理模型提供了密集的逐令牌監督,但其在不同條件下的有效性尚不明確。本文引入了一種無需訓練的診斷框架,能夠在令牌級別量化蒸餾信號與理想梯度的對齊程度。研究發現,蒸餾指導在錯誤滾動輸出上的對齊度顯著高於正確輸出,且最佳蒸餾上下文依賴於學生模型容量和目標任務,不存在通用最優配置。

  • 提出無需訓練的診斷框架,可在逐令牌、逐問題和逐教師級別分析在線策略蒸餾。
  • 定義梯度對齊分數,用於衡量蒸餾信號與理想梯度的餘弦相似度。
站內正文

遞歸語言模型面臨不確定性:自反式程序搜索在長上下文中的驚人效果

本文提出了SRLM框架,通過自反式程序搜索增強遞歸語言模型,利用自一致性、推理痕跡長度和置信度信號來評估上下文交互程序。實驗顯示,SRLM在長上下文任務中比傳統RLM提升高達22%,且遞歸本身並非性能關鍵。

  • SRLM利用三種內在不確定性信號評估程序,提升長上下文處理。
  • 相比遞歸語言模型,SRLM在基準測試中提升22%。
站內正文

在自我中心視頻理解模型中激勵時間感知

多模態大語言模型在視覺理解上表現出色,但在時間感知方面存在不足,尤其在自我中心場景中。蘋果研究團隊提出時間全局策略優化(TGPO)算法,通過強化學習和可驗證獎勵來激勵模型的時間推理能力,避免依賴幀級空間捷徑。

  • 多模態大語言模型在自我中心視頻理解中缺乏時間感知能力
  • 現有訓練目標未能明確獎勵時間推理
站內正文

全部來源