AI News HubLIVE
公开文章 76采集文章 84可信度 90刷新频率 30 分钟
健康状态 健康来源类型 研究原文权限 官方原文最近入库 2026-08-07ID apple-ml-research运行状态 已启用

Official research source; confirm reuse terms before enabling full body display.

最新公开文章

待翻译:Arbitrage: Efficient Reasoning via Advantage-Aware Speculation

AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Modern Large Language Models achieve impressive reasoning capabilities with long Chain of Thoughts, but they incur substantial computational cost during inference, and this motivates techniques to improve the performance-cost ratio. Among these techniques, Speculative Decoding accelerates inference by employing a fast but inaccurate draft model to auto-regressively propose tokens, which are then verified in parallel by a more capable target model. However, due to unnecessary rejections caused by token mismatches in semantically equivalent steps, traditional token-level Speculative Decoding…

  • AI 服务暂时不可用,系统已先保留来源内容与降级元数据。
  • Modern Large Language Models achieve impressive reasoning capabilities with long Chain of Thoughts, but they incur substantial computational cost during inference, and this motiva…
站内正文

待翻译:Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models

AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Large Language Models (LLMs) have achieved state-of-the-art performance on a broad range of Natural Language Processing (NLP) tasks, including document processing and code generation. Autoregressive Language Models (ARMs), which generate tokens sequentially conditioned on all previous tokens, have been the predominant paradigm for LLMs. While these models have achieved high accuracy across a range of downstream tasks, they exhibit low arithmetic intensity due to the inherent sequential dependency in next-token prediction. Recently, Diffusion Language Models (DLMs) have emerged as a promising…

  • AI 服务暂时不可用,系统已先保留来源内容与降级元数据。
  • Large Language Models (LLMs) have achieved state-of-the-art performance on a broad range of Natural Language Processing (NLP) tasks, including document processing and code generat…
站内正文

待翻译:Scaling Categorical Flow Maps

AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Continuous diffusion and flow matching models could represent a powerful alternative to autoregressive approaches for language modelling (LM), as they unlock a host of advantages currently reserved for continuous modalities, including accelerated sampling and tilting. Recently, several works have demonstrated the possibility of generating discrete data continuously by a simple flow matching process between a Gaussian and the one-hot encoded data distribution. They have further shown the feasibility of accelerated sampling via Categorical Flow Maps (CFMs), resulting in competitive sample…

  • AI 服务暂时不可用,系统已先保留来源内容与降级元数据。
  • Continuous diffusion and flow matching models could represent a powerful alternative to autoregressive approaches for language modelling (LM), as they unlock a host of advantages…
站内正文

待翻译:DeepAmbigQA: Ambiguous Multi-hop Questions for Benchmarking LLM Answer Completeness

AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Large language models (LLMs) with integrated search tools show strong promise in open-domain question answering (QA), yet they often struggle to produce complete answer set to complex questions such as “Which actor from the film Heat won at least one Academy Award?”, which requires (1) distinguishing between multiple films sharing the same title and (2) reasoning across a large set of actors to gather and integrate evidence. Existing QA benchmarks rarely evaluate both challenges jointly. To address this, we introduce DEEPAMBIGQAGEN, an automatic data generation pipeline that constructs QA…

  • AI 服务暂时不可用,系统已先保留来源内容与降级元数据。
  • Large language models (LLMs) with integrated search tools show strong promise in open-domain question answering (QA), yet they often struggle to produce complete answer set to com…
站内正文

待翻译:Locking Pretrained Weights via Deep Low-Rank Residual Distillation

AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:The quality of open-weight language models has dramatically improved in recent years. Sharing weights greatly facilitates model adoption by enabling their use across diverse hardware and software platforms. They also allow for more open research and testing, to the extent that users can use them as checkpoints, fine-tune them according to their needs, and potentially redistribute them. In some cases, however, concerns on modifying these weights towards unauthorized uses may outweigh the pros of giving users such a freedom. Defending against such adaptation is non-trivial: since an adaptive…

  • AI 服务暂时不可用,系统已先保留来源内容与降级元数据。
  • The quality of open-weight language models has dramatically improved in recent years. Sharing weights greatly facilitates model adoption by enabling their use across diverse hardw…
站内正文

待翻译:Taming Outlier Tokens in Diffusion Transformers

AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:We study outlier tokens in Diffusion Transformers (DiTs) for image generation. Prior work has shown that Vision Transformers (ViTs) can produce a small number of high-norm tokens that attract disproportionate attention while carrying limited local information, but their role in generative models remains underexplored. We show that this phenomenon appears in both the encoder and denoiser of modern Representation Autoencoder (RAE)-DiT pipelines: pretrained ViT encoders can produce outlier representations, and DiTs themselves can develop internal outlier tokens, especially in intermediate layers…

  • AI 服务暂时不可用,系统已先保留来源内容与降级元数据。
  • We study outlier tokens in Diffusion Transformers (DiTs) for image generation. Prior work has shown that Vision Transformers (ViTs) can produce a small number of high-norm tokens…
站内正文

待翻译:Understanding Alignment in Multimodal LLMs: A Comprehensive Study

AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Preference alignment has become a crucial component in enhancing the performance of Large Language Models (LLMs), yet its impact in Multimodal Large Language Models (MLLMs) remains comparatively underexplored. Similar to language models, MLLMs for image understanding tasks encounter challenges like hallucination. In MLLMs, hallucination can occur not only by stating incorrect facts but also by producing responses that are inconsistent with the image content. A primary objective of alignment for MLLMs is to encourage these models to align responses more closely with image information. Recently…

  • AI 服务暂时不可用,系统已先保留来源内容与降级元数据。
  • Preference alignment has become a crucial component in enhancing the performance of Large Language Models (LLMs), yet its impact in Multimodal Large Language Models (MLLMs) remain…
站内正文

MoMo:通过时空动作标记化实现机器人操作中的运动模式调节

机器人需根据任务、物体和交互环境调整操作方式,而不仅限于精确执行。本文提出MoMo,一个两阶段模仿学习框架,包含时空动作标记器和行为克隆Transformer,可输入连续的运动模式条件。在六个真实机器人操作任务中,改变该条件可产生稳定、动态及中间行为,且人类评估者能够区分。在仅演示一种模式的任务上,MoMo能转移未见过的请求模式,同时基本保持任务成功率,展示了任务-模式组合的泛化能力。

  • MoMo框架通过时空动作标记化将执行层面的变化作为可复用行为因素进行学习。
  • 连续运动模式条件可在六个真实任务中产生稳定、动态等不同行为。
站内正文

降维与网络科学的融合:基于UMAP kNN图的数据理解

UMAP广泛用于高维数据探索,但典型工作只关注其低维嵌入,忽略了内部构建的k近邻(kNN)图。该图在原始高维空间编码数据流形,避免了2D投影的失真。本文展示了这一内部表示的潜力:通过应用PageRank、k-core分解和聚类系数等标准图算法,可以增强数据理解。在MNIST和Fashion MNIST上的评估表明,这些基于图的分析不仅实用,而且与专用方法(如k-medoids、HDBSCAN)相比具有竞争力或互补性。

  • UMAP的kNN图在二维嵌入失真前保留了高维流形结构。
  • 将PageRank、k-core分解和聚类系数等图算法应用于该图,实现新的数据探索能力。
站内正文

基于解耦时间深度扩散变换器的内存高效音频合成

Apple 发布了 Siri Expressive Voices,其背后是名为“去分词器”的内存高效音频合成架构。该架构将基础模型发出的语义音频令牌转换为高保真音频,在 Apple Matrix 协处理器(AMX)的严格计算和内存预算内运行。它采用三组件设计:流式编码器、时间解码器和深度解码器,系统性地解耦时间和深度处理。单个可重复使用的深度解码器利用扩散变换器(DiT)风格的阶段条件生成所有 RVQ 层级,取代了先前多解码器架构中专用的逐层解码器。因果滑动窗口注意力与固定窗口键值缓存使内存复杂度与序列长度无关。在 AMX 上部署时,去分词器每个生成步骤约需 10ms(比实时快约 16 倍),峰值运行时内存约 21MB,设备端资产 329MB,可在设备端基础模型旁连续流式合成 20-320 秒的音频。该架构已部署在 Siri Expressive Voices 中,在 AFM 3 Core Advanced(10 亿参数激活规模)下运行,平均意见得分(MOS)比之前的设备端文本转语音系统整体提升 0.28(4.15 vs. 3.87),在对话语音上提升 0.42(4.24 vs. 3.82)。

  • Apple 发布 Siri Expressive Voices,采用新的去分词器架构实现内存高效的设备端音频合成。
  • 该架构解耦时间和深度处理,使用单个深度解码器生成所有 RVQ 层级,内存占用恒定。
站内正文

GH-ESD:面向实例级视觉任务的基于假设的误差切片发现方法

GH-ESD是一种新颖的误差切片发现框架,专门针对实例级视觉任务(如目标检测和分割)设计。它通过生成与验证范式,利用大语言模型先验和视觉语言模型在实例级发现假设切片,并统计验证,从而识别出由于上下文关系和空间模式导致的系统失败。实验表明,该方法在GESD基准上显著优于现有基线。

  • 现有切片发现方法主要适用于图像级分类,难以捕获实例级任务中由上下文关系和空间模式导致的失败。
  • GH-ESD采用生成-验证框架,结合LLM先验和视觉语言模型在实例级生成并验证假设切片。
站内正文

LEAD:突破长程推理中的不可恢复瓶颈

大型语言模型在执行长程任务时即使有高级策略也会出现不稳定。研究发现,虽然分解对稳定性至关重要,但过度分解会导致“不可恢复瓶颈”,即在少数“困难”步骤上的一致错误变得不可逆转。为此,提出了前瞻增强原子分解(LEAD),通过结合短期未来验证和聚合重叠样本来提供足够的隔离和局部上下文,从而纠正错误。该方法使o4-mini模型在Checkers Jumping问题中解决了n=13的复杂度,而极端分解在n=11时就失败。

  • 长程执行在LLM中仍然不稳定,即使提供了高级策略。
  • 极端分解会创建“不可恢复瓶颈”,使得在少数困难步骤上的错误不可逆。
站内正文

利用校准稀疏注意力加速文本到视频生成

本文提出CalibAtt,一种无需训练的稀疏注意力方法,通过离线校准识别稳定的稀疏模式,在推理时跳过不重要连接,实现最高1.58倍端到端加速,且不降低视频生成质量。

  • 发现大量token连接分数可忽略且模式重复,可跳过计算
  • CalibAtt离线校准并编译稀疏模式到优化注意力操作
站内正文

无环境合成数据生成:为API调用智能体训练

苹果研究团队提出一种无需真实环境的合成数据生成方法,利用LLM作为数字世界模型,仅通过API规范生成高质量轨迹。在AppWorld和OfficeBench上微调模型取得显著性能提升,为API智能体训练提供了可扩展的解决方案。

  • 传统方法依赖完整的执行环境,限制数据规模
  • 新方法使用LLM模拟API响应生成轨迹
站内正文

长度价值模型:面向令牌级长度建模的可扩展价值预训练

苹果研究人员提出长度价值模型(LenVM),一种在解码每一步预测剩余生成长度的令牌级框架。通过将长度建模转化为价值估计问题,并赋予每个生成令牌恒定负奖励,LenVM实现了无标注、密集、无偏且可扩展的监督。在LLM和VLM上的实验显示,在LIFEBench精确长度匹配任务中,LenVM将7B模型的长度分数从30.9提升至64.8,超越前沿闭源模型。此外,LenVM支持长度控制、预测和生成动态解释。

  • LenVM是令牌级框架,预测每一步的剩余生成长度。
  • 通过价值估计和恒定负奖励实现无标注监督。
站内正文

LVSum:时间戳感知的长视频摘要基准

LVSum是一个人工标注的基准,用于评估多模态大模型在长视频摘要中的时间对齐能力。包含72个视频,平均时长16分钟,每个视频有最多10个人工生成的含时间参考的摘要。研究发现,转录文本比视觉帧贡献更大,模型与人工摘要差距显著,且MLLMs在时间定位、指令遵循和跨模态一致性方面存在系统性弱点。

  • 引入LVSum基准,包含72个跨领域长视频,带细粒度时间对齐的人工摘要。
  • 转录文本对摘要质量的贡献远超视觉帧。
站内正文

示例说明:从图像集中推断视觉概念

视觉语言模型(VLM)能够遵循复杂的文本指令,但难以仅从视觉上下文中进行推理。新提出的视觉概念推断任务(VICIS)评估了这一能力。作者提出了一个训练框架和架构,学习从图像集中提取概念特定嵌入,从而提升生成准确性和对未见概念及模态的泛化能力。

  • VLM无法从纯视觉上下文集中推断概念,容易产生有偏见的生成。
  • VICIS任务测试将上下文定义的概念应用于新查询图像的能力。
站内正文

当遗忘是免费的:利用低影响力数据点降低计算成本

一篇新论文挑战了机器学习中遗忘(unlearning)的标准方法,提出并非所有需要遗忘的数据点都需同等对待。通过分析影响函数,研究者识别出对模型输出影响可忽略的训练数据子集,并在遗忘前缩减数据集规模,实际示例中实现约50%的计算节省。

  • 现有遗忘方法平等对待所有遗忘点,但部分点对模型影响极小
  • 利用影响函数识别低影响点,可安全跳过这些点的遗忘操作
站内正文

令人惊讶的简单自蒸馏方法提升代码生成能力

苹果研究人员提出简单自蒸馏(SSD)方法,仅利用模型自身的输出进行微调,无需验证器、教师模型或强化学习,显著提升了代码生成性能,在LiveCodeBench v6上将Qwen3-30B-Instruct的pass@1从42.4%提高到55.3%。

  • SSD通过采样自身输出并进行标准监督微调来改进模型
  • 在LiveCodeBench v6上提升了13个百分点,尤其对难题效果显著
站内正文

混合文本与ID嵌入的个性化增量视频搜索

本文提出了一种针对Apple TV搜索的个性化系统,结合文本嵌入和ID协作嵌入,通过对比学习和交互数据学习物品表征。在运行时,利用用户历史构建表征并注入XGBoost排名器。离线实验显示,在模糊前缀查询上NDCG@10提升8.63%,长历史用户获益更大。在线实验获得点击率+1.14%和转化率+1.23%的显著提升。

  • 提出融合文本多语言编码器与ID协作嵌入的混合方法
  • 在模糊短查询(1-3字符)上NDCG@10提升8.63%
站内正文

双亚线性交互式接近性证明

本文研究双亚线性交互式接近性证明(dsIPPs),这是一种超快速生成和验证的证明系统,可用于证明关于海量输入的近似断言。证明者只需读取输入的一小部分(亚线性),而验证者读取的部分更少。作者为任意可由常宽度一次性无记忆分支程序(ROOBP)决定的属性构造了此类系统,还构建了针对输入汉明重量近似验证以及有界度图模型中二分性松弛的证明系统。

  • dsIPP允许证明者在亚线性时间内生成证明,验证者所需时间更少。
  • 为ROOBP可判定的属性构造了通用的dsIPP。
站内正文

大语言模型函数调用的不确定性量化

首次评估了LLM函数调用中的不确定性量化方法,发现多采样方法不优于单采样方法,并提出基于抽象语法树聚类和语义标记选择的改进策略。

  • 首次评估LLM函数调用场景下的不确定性量化方法
  • 多采样UQ方法(如语义熵)在函数调用中无显著优势
站内正文

CLaRa:通过连续潜在推理连接检索与生成

CLaRa是一种统一的检索增强生成框架,通过将文档压缩为连续向量并端到端联合优化重排序器和生成器,显著减少了上下文长度,提高了问答性能。其关键创新包括基于问答和释义的SCP数据合成以及可微分的top-k估计器,实现了高达16倍的压缩率,超越了基于文本的基线方法。

  • CLaRa使用嵌入压缩将文档缩短为连续向量,减少输入生成器的长度。
  • 引入SCP框架,通过问答和释义监督生成保留关键信息的压缩表示。
站内正文

单层足矣:适配预训练视觉编码器用于图像生成

提出FAE(特征自编码器)框架,仅用单个注意力层即可将预训练视觉表示适配为低维生成潜空间,在ImageNet 256×256上达到接近SOTA的FID 1.29(含CFG)和1.48(无CFG),兼顾重建与理解信息。

  • FAE通过两个独立解码器耦合,分别用于重建原始特征空间和图像生成,仅需单层注意力。
  • 兼容多种自监督编码器(如DINO、SigLIP)和生成模型(扩散模型、归一化流)。
站内正文

Apple Music搜索的多语言语义检索系统

Apple Music为150多个地区、数十种语言的用户提供服务,每天新增数十万首曲目。针对拼写错误、音译和跨语言查询的搜索召回率成为影响用户体验的关键。苹果研究人员提出了一种基于3.05亿参数Siamese双编码器的多语言语义检索系统,通过混合检索架构与现有索引结合,实现了69%的Hit@10相对改进,在线A/B测试中整体转化率提升2.28%,无结果率降低86%,长尾查询转化率提升7.93%。

  • Apple Music推出多语言语义检索系统,基于GTE-multilingual-base微调的3.05亿参数Siamese双编码器。
  • 采用混合检索架构,结合密集向量和基于令牌的索引,无需重新训练下游排序器。
站内正文

主动代理研究环境:模拟活跃用户以评估主动助手

研究人员提出了Pare框架,通过有限状态机建模应用程序,实现对主动代理在数字环境中的真实用户仿真,并发布了包含143个任务的Pare-Bench基准测试。

  • 现有方法将应用建模为平面工具调用API,无法捕捉用户交互的状态性和顺序性。
  • Pare框架将应用建模为具有状态导航和状态相关动作空间的有限状态机。
站内正文

行为隐私泄露:代理协商中的推理攻击形式化与随机策略缓解

该论文被ARES 2026的AI4TCI研讨会接收。研究关注自主协商代理在高风险场景(如保险和采购)中的行为隐私泄露问题。作者设计了一种自适应随机协商策略,在保证(ε,δ)-差分隐私和几乎必然收敛的同时,将对手推理准确性降低43-50%,并将协商成功率和效用维持在90%以上。

  • 针对协商代理的行为隐私泄露,形式化推理攻击并设计随机化防御策略
  • 基于差分隐私的自适应策略保证几乎必然收敛
站内正文

揭秘在线策略蒸馏:何时有益,何时有害,以及原因

尽管在线策略蒸馏为训练推理模型提供了密集的逐令牌监督,但其在不同条件下的有效性尚不明确。本文引入了一种无需训练的诊断框架,能够在令牌级别量化蒸馏信号与理想梯度的对齐程度。研究发现,蒸馏指导在错误滚动输出上的对齐度显著高于正确输出,且最佳蒸馏上下文依赖于学生模型容量和目标任务,不存在通用最优配置。

  • 提出无需训练的诊断框架,可在逐令牌、逐问题和逐教师级别分析在线策略蒸馏。
  • 定义梯度对齐分数,用于衡量蒸馏信号与理想梯度的余弦相似度。
站内正文

递归语言模型面临不确定性:自反式程序搜索在长上下文中的惊人效果

本文提出了SRLM框架,通过自反式程序搜索增强递归语言模型,利用自一致性、推理痕迹长度和置信度信号来评估上下文交互程序。实验显示,SRLM在长上下文任务中比传统RLM提升高达22%,且递归本身并非性能关键。

  • SRLM利用三种内在不确定性信号评估程序,提升长上下文处理。
  • 相比递归语言模型,SRLM在基准测试中提升22%。
站内正文

在自我中心视频理解模型中激励时间感知

多模态大语言模型在视觉理解上表现出色,但在时间感知方面存在不足,尤其在自我中心场景中。苹果研究团队提出时间全局策略优化(TGPO)算法,通过强化学习和可验证奖励来激励模型的时间推理能力,避免依赖帧级空间捷径。

  • 多模态大语言模型在自我中心视频理解中缺乏时间感知能力
  • 现有训练目标未能明确奖励时间推理
站内正文

全部来源