一项大规模研究表明,在生物医学问答中,检索增强生成(RAG)带来的提升很小且不稳定,通常仅为1-2个百分点。骨干模型的选择比检索器或语料库的选择影响更大,专家和普通检索来源表现相似。
AI 新闻实时情报
实时监测
实时更新
实时跟踪可信来源,保留出处、权限和站内阅读模式,把噪声压成可读情报。
实时更新
SALIMORY是一个新框架,通过训练单一语言模型管理结构化认知记忆(包括用户事实、偏好和工作记忆),解决了对话代理长期记忆难题。它引入分层阶段过程奖励和奖励分解对比细化,端到端监督选择性过滤、整合和线索驱动回忆等操作。该方法将记忆相关故障减少三分之一,端到端准确率提升超10%,良好个性化率翻倍。
本文回顾了在科学史、科学哲学和科学社会学中,从早期数字方法到大型语言模型(LLM)的计算概念分析方法。文章分为两部分:第一部分探讨了LLM之前的计算概念史,包括早期数字方法、分布语义方法和词汇语义变化检测;第二部分则聚焦LLM时代,介绍LLM在词汇语义变化检测中的应用及相关案例研究,并重新审视了语料库构建、模型选择、操作化权衡等方法论问题。
一项新研究探讨了不同话语角色标签(如“引用:”、“指令:”、“示例:”)如何影响语言模型对上下文的采纳程度。通过在500个MMLU-Pro项目上使用固定内容探针,发现标签可将误导采纳率改变56-84个百分点。指令和引用等标签增加采纳,而示例标签抑制采纳。研究建议在RAG基准测试中报告并控制包装器标签。
POLARIS是一种针对小型开源模型的训练方法,通过GRPO策略结合LLM裁判和人类参考注入,显著提升了长文本创作能力。训练后的9B模型在长度遵循度和质量上可与27B模型媲美,并展现出强大的长度泛化能力。
本文介绍LiftQuant,一种通过“提升-投影”机制实现连续位宽控制的新框架。该方法将低维权重向量近似为高维1比特晶格的投影,实现位宽准连续调节。实验表明,LiftQuant可将70B模型压缩至2.4比特,精确适配24GB GPU,性能超越现有2比特模型。该论文已被ICML 2026接收为Spotlight。
本文研究了如何将最大更新参数化(μP)扩展到门控Delta网络,这是一种高效的线性模型架构。通过严格分析前向传播、门控机制和循环状态动态中的坐标大小,作者推导出了缩放规则。实验表明,在AdamW和SGD优化器下,所提出的配置能够实现不同模型宽度间的稳定学习率迁移,而标准参数化则无法迁移。
本文为固定监督决策问题定义了“贝叶斯充分表示”。该表示依赖于损失函数,并引入贝叶斯商概念,区分了充分性与最小性。实验表明,最小化非必需信息可提升泛化能力。
本研究提出了一种利用深度神经网络代理建模和非参数梯度优化进行逆临界实验设计的方法,旨在最大化实验与目标技术之间的中子相似性系数c_k。该方法结合U-Net编码器-解码器与新型多群注意力池化层,通过直接优化几何网格材料分配来提升c_k。应用于HALEU燃料运输容器验证,对三种配置分别取得0.97757、0.81324和0.93276的高分,展示了深度学习在加速核技术验证中的潜力。
一篇系统研究查询-键-值(QKV)注意力机制中投影共享的论文,发现共享键值投影(Q-K=V)可在仅降低3.1%困惑度的情况下减少50%的KV缓存,结合分组查询注意力(GQA)或多查询注意力(MQA)可分别减少87.5%和96.9%的缓存,实现设备端推理。该研究通过合成任务、视觉和语言建模实验验证,并公开了代码。
本文针对耦合梯度下降算法(常见于双层优化、两时间尺度随机逼近和对抗训练)中的瞬态放大现象,提出了一个尖锐的伪谱分析。作者证明了块三角雅可比矩阵的Kreiss常数界限,并给出了有限时间迭代复杂度界。该理论揭示了传统谱分析无法看到的非渐近高维学习动力学区域,在线性二次型问题和神经网络训练中的实验证实了该理论。
本文提出,部署在现实世界中的强化学习系统应转向持续学习范式,而非传统的“先训练再修复”模式。作者识别了部署后四种非平稳性来源,并分析了持续RL的成功案例,倡导社区变革。
IEEE P3109草案标准定义了一组参数化的二进制浮点格式及相关操作,专注于支持机器学习。这些格式允许在少量比特内高效且一致地表示数值,参数包括位宽、精度、有符号性和无穷大的存在。操作通过将浮点值解码为闭扩展实数集(包含正负无穷和NaN)来定义,明确处理NaN和无穷操作数以确保仅调用实数运算。定义了广泛的舍入和饱和模式,包括随机舍入。操作无异常,通过返回值(如NaN)传达异常情况,加速了吞吐量。此外,引入了名为kappa近似的尺度不变度量,用于描述近似实现。标准函数定义和其他属性通过形式规范进行了机械验证和生成。
一项新研究利用XGBoost模型和八种常规临床指标,在ADNI数据集上实现了对正常认知、轻度认知障碍和阿尔茨海默病的高精度三分类检测,宏AUC达到0.982,并通过SHAP值提供了可解释性。
本文研究了在长时间任务中何时中断自主AI智能体的挑战。通过使用HEART情感动力学模型,作者评估了四类干预触发器,并报告了三个主要发现:状态饱和陷阱(挫败感指标迅速达到最大值)、LLM法官的能力下限,以及最关键的——人类标注者间极低的评分者间信度,这质疑了使用单一标注者F1分数作为优化目标的有效性。
这项研究探讨了数学家如何利用AI进行数学证明的形式化。通过调查和用户实验,发现人们希望AI协助但保留高级控制权,使用AI能提高准确率,并且用户倾向于使用多种AI工具。
新基准Curation-Bench测试通用编码智能体能否自主筛选训练数据。现成智能体在十次迭代内达到强基线水平,但倾向于调整局部策略而非探索新策略族。要求每次迭代引用并改编先前方法的脚手架智能体,自主发现了一种以十分之一数据预算超越基线的策略,表明结构化方法适应是关键。
StepPRM-RTL是一个结合逐步轨迹建模、过程奖励模型(PRM)和检索增强微调(RAFT)的框架,用于提升LLM生成RTL代码的功能正确性和推理保真度。在基准测试中,功能正确性和推理保真度指标相比最佳先前方法提升超过10%。
多模态大语言模型在复杂推理中表现优秀,但在需要借助工具进行可视化辅助时性能下降。为此,研究者提出了VAMPS基准,包含1168道双语选择题,源自伊朗大学入学考试,用于评估模型在构造图形并基于图形推理方面的能力。实验表明,直接分析求解方式优于工具辅助的视觉求解。
SMAC-Talk 是星际争霸多智能体挑战(SMAC)的自然语言扩展,专为评估基于大语言模型(LLM)的智能体在协作多智能体环境中的表现而设计。该环境保留了分散控制、部分可观测性和长期决策等关键特性,并新增了一个自然语言通信通道,用于探测智能体的协调与信任。研究设置了包含欺骗性通信者的场景,并使用 Qwen3.5 系列中的四个模型进行了基准测试,考察了推理结构、记忆和模型规模对协调的影响。SMAC-Talk 已作为开放基准发布。
大型语言模型正在重塑研究实践,同时悄然削弱研究者的认识论责任。PEEL框架结合了Voyant Tools的确定性远读和Claude的LLM解释,以皮尔斯符号学和溯因推理为基础,揭示了AI生成文本中的系统性扭曲。关键启示:确定性工具必须伴随AI工具,流畅性不等于保真度,认识论权威必须被设计进去。
本文质疑了公众对AI情感支持的常见假设,指出AI情感支持通常是在通用平台的任务导向互动中偶然发生,而非用户刻意寻求。这种偶然的积极体验会改变人们对AI情感能力的看法,导致未来更倾向于向AI而非人类寻求支持。与OpenAI合作的一项为期28天的纵向研究发现,每天仅5分钟的AI对话就使得向人类寻求支持的偏好下降10.3%,对AI的偏好上升11.6%。这表明当前针对专用伴侣应用的政策不足,需要监管通用AI系统并关注累积性变化。
本文提出一种基于本体的验证框架,用于企业AI代理的部署前保障。该框架包含三个组件:代理操作包络、本体到场景生成管道以及信任证书。在四个受监管行业(金融科技、银行、保险、医疗)的试点中,生成了1800个场景,并通过125个监管要求和25个注入故障进行评估。结果表明,基于本体的场景生成在监管覆盖率和领域特异性方面优于基于角色的基线方法。
欧盟委员会新出台的《云与人工智能发展法案》(CADA)引入了雄心勃勃的‘开源优先’原则,设立200亿欧元投资和主权认证框架。然而,法案在强制要求开源软件优于专有软件方面仍显不足,缺乏可执行的法律程序。
OpenAI首席执行官山姆·奥特曼宣布,将为Y Combinator 2026年春夏两期初创公司提供一项试点计划:以200万美元的OpenAI代币换取公司股权。该交易采用无上限的SAFE协议,且不含最惠国待遇条款。此举标志着AI正在改变创业公司的融资模式,也延续了奥特曼与YC的长期合作关系。
今天的AI新闻涵盖了多个重要发布:微软的MAI-Thinking-1技术报告及其透明度;Gemma 4 12B开源多模态模型;Ideogram 4.0开源权重成为最佳开源图像模型;文本到语音模型Miso One等。此外,还讨论了AI代理框架向执行层的转变,以及模型路由和成本控制的现实考量。
本文探讨模型中立性对AI代理的重要性,并指出各大实验室正通过工具层锁定客户,而开源的抽象层解决方案是关键。
一项系统综述将口腔医疗中的大型AI模型分为语言生成、判别视觉基础和口腔专用基础三大类,基于97项研究指出它们互补但面临幻觉、数据稀缺和缺乏标准化评估等挑战。
据《The Information》报道,Meta正在开发一款AI挂件,并计划在年底前推出多达四款新的智能眼镜,以弥补其Reality Labs部门的巨额亏损。公司还计划推出面向企业的订阅服务“Wearables for Work”。
AI Gauge 是一款开源的桌面小工具,可实时监控 Claude、ChatGPT Codex、GitHub Copilot 和 OpenRouter 的使用量、剩余额度及重置时间,帮助管理多个AI订阅。支持 Windows、macOS 和 Linux,具有原生界面和多种刷新方式。