VesselSim提出一个两阶段框架,通过随机几何驱动模拟生成16,500个解剖学合理的3D血管造影体积,并仅用合成数据训练3D U-Net。采用测试时自适应策略弥合域差距,在真实MRI和CT数据集上达到与最先进基础模型竞争的性能,显著减少对专家标注的依赖。
AI 新闻实时情报
实时监测
实时更新
实时跟踪可信来源,保留出处、权限和站内阅读模式,把噪声压成可读情报。
实时更新
研究人员提出一种新的情绪表征——维度分布情绪状态(DDES),利用效价和唤醒度预测艺术作品引发的情感反应,辅助博物馆策展人设计以情绪为基础的展览。
LongAV-Compass是一个系统化基准,用于评估分钟级视听生成任务,涵盖文本到视听、图像到视听和视频到视听三种模态。包含284个测试案例,集成多模态大模型辅助评估和感知指标,评估超过20个细粒度维度。对11个代表性模型的实验揭示了当前系统在长时间生成中的局限性。
RoMo是一个大规模、高质量的人体运动数据集,通过分类感知过滤管道去除静态和伪影序列,采用新颖的三级语义分类体系进行标注,支持细粒度评估,训练模型在保真度和多样性方面达到最先进水平,并发布了Motion Toolbox以标准化指标和数据转换。
本文研究城市规模户外环境中分散的具身智能体如何通过自然语言通信协调行动,提出Sentinel Challenge基准和CoSaR框架,结合基础模型的高层通信与经典空间导航算法,实现更快的聚集、更短的路径和更高的安全性。
DuoGesture是一种神经启发、生物力学引导的双流方法,将共语手势生成分解为语义流和节拍流。通过语义变分信息瓶颈协调两流,并用运动接地语义条件增强语义流,惯性节拍先验提升节拍流的平滑度。实验表明其优于整体基线。
预训练视频大模型在视觉推理上表现出色,但处理带有音频、深度图等辅助流的视频时,统一融合会导致模态干扰。为此,研究者提出UniMVU框架,通过两层动态门控(内模态门和模态级门)实现指令感知融合,在六个基准上取得最高13.5 CIDEr的提升,且门控机制与人类可解释的模态相关性一致。
该研究引入EnterpriseMem-Bench,一个多轮Text-to-SQL基准测试,包含300个会话和1400轮查询。评估五种前沿模型发现:无状态模型在第三轮准确率归零;内存复杂度不单调提升性能,工作内存占主导;Claude Sonnet 4.6在SEC EDGAR上出现代际退化;推理模式下Claude错误分布变为单模态。
该论文提出一种可泛化的文化评估与干预框架,通过情境化行为探测和潜在激活引导,在不重新训练的情况下调整大语言模型的文化价值对齐。实验发现文化价值存在潜在纠缠现象,表明价值观以耦合结构编码。
一项新研究揭示了大型语言模型(LLM)在处理结构化知识(如图和表格)时产生幻觉的机制。研究发现,幻觉源于系统性的内部动态,而非随机噪声:注意力过度集中于类似捷径的结构线索,而前馈表示无法将知识接地,导致模型退回到参数记忆。这些模式在不同结构化知识格式中普遍存在,可用于幻觉检测。
本研究从梯度下降的角度重新审视检索增强生成(RAG),证明线性自注意力层可以执行统一线性化RAG目标的梯度下降步骤,从而在检索增强预测与情境内优化之间建立精确对应关系。基于这一发现,作者提出了一种轻量级方法,通过仅前向传播的更新来优化冻结RAG大语言模型的证据使用接口。在七个问答基准测试中,该方法在保持检索器和骨干网络固定的情况下,显著提升了基线性能,并能在更低计算成本下接近测试时梯度优化的效果。
检索正从单次匹配向交互式推理发展,语言代理需迭代检查证据、重构查询并再次搜索。训练此类代理面临信用分配挑战:可执行动作(如查询或摘要)可由检索器直接评估,而潜在推理步骤无法直接观察且仅影响未来可执行动作。这种不对称性使基于最终结果的奖励分配不可靠。本文提出RICE-PO,一种无需批评者的策略优化框架,将检索交互转化为局部学习信号。RICE-PO选择高不确定性的可执行动作作为锚点,使用检索指标评估局部反事实分支,并仅在推理到动作的影响强且未来残余效应稳定时,将信用传播给潜在推理步骤。在BRIGHT和BEIR基准上,相同检索器设置下,RICE-PO一致优于基于提示的代理和基于群体的强化学习基线。结果表明,代理-环境交互的结构本身可为训练基于推理的检索代理提供有效监督。
本文介绍了“每日剂量”(TDD)系统,这是一个由大语言模型驱动的自动化临床总结和临床试验识别系统,集成到常规放射肿瘤学实践中。通过混合方法评估,对55名临床医生进行了调查,结果显示系统具有良好的可用性、满意度,并有望节省时间。
CroCo方法将对比偏好调优扩展到多语言场景,利用英语奖励模型为多语言自生成响应排序,无需语言特定偏好标注。实验表明,在线内策略数据下,该方法在14种语言的结构化与开放生成任务中显著提升模型性能。
SPEAR(沙盒化主动回滚提示工程师)是一种自由形式的智能优化器,将代码即行动范式引入自动提示工程。它配备评估、Python、设置提示和完成四个工具,可自主决策如何使用。其独特之处在于Python沙盒,允许优化器编写和执行任意Python代码以进行结构性错误分析。两个防护栏确保单调改进:指标回归时自动回滚和可选防护指标下限。在三个工业LLM裁判套件(13个裁判任务)以及7个BBH任务和GSM8K上评估,SPEAR在所有工业任务的主要指标上获胜,并在BBH-7上平均准确率0.938。消融实验显示Python工具是最重要的杠杆。
本综述首次统一了预训练数据暴露(PDE)框架下的成员推理和数据污染研究,形式化定义了不同暴露水平,回顾了攻击与防御方法,综合了实证发现,并指出了开放挑战和未来方向。
提出自验证蒸馏(Self-Verified Distillation, SVD)方法,让大语言模型仅利用无标签提示进行自我改进,无需外部教师或工具反馈。在数学、科学和编程三个推理领域,Qwen3模型通过SVD训练后性能显著提升。
本文提出一种神经规则评估器,将逻辑约束编译为有向无环图,并引入奇美拉训练方法以解决训练中真实异常样本稀缺的问题。在CLEVRER、OpenImages和VidOR等数据集上,该方法显著提升了逻辑异常检测的性能,尤其在组合性和关系性规则方面。
本文提出李群嵌入动态神经网络(LieEDNN),利用伴随李群作用解决李群与加法运算不兼容及动力学在非线性空间中演化的问题,实现稳定可学习的神经动力学,并在SE(3)上以伸缩机械臂为应用验证。
提出PushCen-ADFL框架,通过质心表示空间耦合通信、聚合与局部稳定,采用保平均推和混合校正聚合偏差,利用轻量质心正则化缓解异质性和陈旧性引起的模型漂移,并引入有界去重缓冲区提升鲁棒性。在视觉数据集上准确率提升高达6%,通信成本降低80%以上。
针对时间序列基础模型(TSFMs)在预训练中可能遇到评估数据集导致性能评估过于乐观的问题,本文首次研究了TSFMs的预训练数据污染审计。提出TSFMAudit方法,基于探测适应动态,通过微调探测后污染数据集更快的损失下降和更小的骨干网络移动来检测污染。在6个TSFMs和187个数据集上评估,优于10个基线方法。
神经贝叶斯顺序路由(NBSR)是一种将神经推理建模为有向无环图上主动证据累积的框架。它利用狄利克雷-分类共轭框架,通过全局知识库提取正证据向量,并采用Gumbel-Softmax直通估计器实现硬路径路由。该框架提供不确定性量化、早期退出、分布外拒绝和成本感知证据获取机制。理论证明单调精度增长和有界方差,实验表明其在多种任务中具有竞争力的性能。
SilIF通过对孤立森林的路径长度向量进行聚类并计算轮廓分数,提升无监督异常检测性能。在IEEE-CIS欺诈检测基准上,AUC-PR平均提升0.0080,但在Sparkov合成数据集上未见改进。
AirCast-SR是一个基础模型,能够将全球AI天气预报从0.25度(约28公里)分辨率降尺度到1公里水平分辨率,时间分辨率为每小时。它采用三维U-Net结合潜在一致性模型扩散框架,在美国本土的数据上训练。该模型实现了近乎零偏差,并保留了精细尺度的大气结构,经过多个季节的验证,并展示了在无需重新训练的情况下对印度和德国的零样本迁移能力。
该论文提出“约束税”概念,衡量结构化输出约束对小型语言模型答案准确性的损失。实验表明,强制遵循JSON等模式虽提升格式正确性,但显著降低答案准确性,建议采用“先自由推理,后约束打包”的设计模式。
本文提出GEM(几何熵混合)框架,将数据策展重构为超球面上的变分问题,通过混合平衡正则化器克服聚类坍塌,发现欧几里得启发式无法识别的平衡语义结构。结合教师-学生蒸馏扩展到网络规模语料,引入几何影响分数(GIS)用于可解释的类别生成。在1.1B参数模型上的实验表明,GEM集成了DoReMi和RegMix等混合策略,平均下游准确率提升达1.2%,为可预测的数据混合提供了鲁棒的坐标系统。
JobBench是一个新的AI代理基准测试,它评估代理在专家认为最值得委派的工作流程上的表现,旨在强调增强而非替代人类。
当前评估大语言模型(LLM)心智理论(ToM)的方法多依赖最终答案,无法揭示模型是否真正构建了心理状态表征。本研究提出OmniToM基准,通过显式建模故事中所有角色的信念结构来直接评估。基准包含信念提取与信念标注两阶段,采用七维标签体系。基于895个故事和22,343个标注信念命题,借助人类校准的LLM辅助流程构建。零样本评估表明,LLM在将叙事事实转化为角色信念和共享心理状态时存在瓶颈。
AI智能体正开始完成有价值的长期业务运营任务,但企业工作的训练和评估环境在真实性、可验证性和规模之间难以平衡。环境与任务创建经常遭受一种称为“工件漂移”的失败模式:当指令、环境、预测器和验证器由松散耦合的过程创建时,它们经常对任务要求产生分歧,导致环境不可解、可奖励篡改或不一致。本文提出Anchor,一种将领域专家的业务流程规范形式化为约束优化程序的任务生成管道。通过单个参数化规范,管道联合生成自然语言指令、环境配置、求解器认证的真实解决方案和基于状态的验证器。通过改变参数,可产生具有可控难度和已知最优解的新任务,生成仅依赖最终状态业务正确性的与框架无关的环境。作者应用Anchor创建了ERP-Bench,一个包含300个长期任务的基准测试,涵盖生产级ERP系统中的采购和制造工作流。实验发现前沿模型在26.1%的试验中满足显式任务约束,但仅17.4%达到完全最优解。总体而言,Anchor和ERP-Bench为构建可审计的评估环境提供了具体方案,用于评估具有经济价值的智能体工作。
本文介绍了两种新颖的自主AI代理框架——DeepTS/DeepCollector和DeepScribe,它们利用混合本地-远程架构自动化科学工作流程,包括时间序列数据整理和讲座报告转换,并讨论了向知识图谱和高能物理的扩展。