GraphDiff-IK提出了一种结构感知的图扩散逆运动学框架,能够在多种机器人形态下准确、稳定地生成关节配置,并支持多解输出。
AI 新闻实时情报
实时监测
实时更新
实时跟踪可信来源,保留出处、权限和站内阅读模式,把噪声压成可读情报。
实时更新
提出自适应动力学编排(ADO)框架,用于自动驾驶导航中的模型预测控制。ADO动态选择最适合当前导航上下文的动力学模型,通过在线反事实推演优化模型选择,从而在保持低延迟的同时接近高保真模型的精度。野外实验验证了其在复杂地形中的有效性。
本文提出Invascal,一种架构无关的不确定性感知适配器头,通过偏好头和强度头分解预测,并利用逆空窗自校准目标实现可靠的不确定性估计,在保持分割精度的同时显著改善校准效果,计算开销极低。
研究表明,在低雷诺数流体中,线性运动映射扩展到任何幂律粘度流体,而卡拉-安田流体的非线性特性允许通过往复运动实现净位移,甚至可通过改变速度切换运动方向。
该论文提出一种强化学习代理,用于为机电系统的系统辨识生成最优激励信号,并在Quanser Aero 2测试平台上验证,实现了高估计精度且仅0.75%的安全违规。
本综述系统梳理了利用人类视频数据训练视觉-语言-动作(VLA)模型的方法,将其分为潜在动作表示、预测世界模型、显式2D监督和显式3D重建四类,并指出视频结构化、跨实体动作接地和评估协议设计三大挑战,旨在降低对昂贵机器人演示数据的依赖。
VLAMotor是一种新型框架,用于增强视觉-语言-动作(VLA)模型。它通过距离感知测试暴露失败模式,并利用智能体合成数据微调模型。在模拟和真实机器人操作任务中,VLAMotor显著提高了失败检测率和任务成功率。
提出一种分割引导的空间索引方法,通过语义选择面部区域补丁(而非整体特征)进行深度伪造检测,在Celeb-DF v2上达到0.905 AUC,优于现有方法,且无需微调或目标域数据。
本文研究了视觉代理在复杂推理任务中工具使用的现象,发现“工具使用崩塌”——模型随着训练逐渐停止使用工具但准确性却提高。作者提出通过熵正则化鼓励多样化探索,获得最佳性能,表明工具应作为训练时的支架而非最终依赖。
一种名为HSGM的新型零样本框架通过将3D信息转换为与VLM兼容的分层地图,弥合了视觉语言导航中的语义几何鸿沟,在R2R-CE和RxR-CE基准测试上取得了最先进的性能。
研究人员提出了MIND(数据流形感知图像扩散模型),通过将离散补丁标记化集成到连续扩散模型的得分函数中,显式建模流形几何。该方法在ImageNet 256×256上实现了FID 2.06(MIND-B,1.3亿参数),优于LlamaGen-3B(31亿参数)的FID。
研究人员提出将细胞层(cellular sheaves)应用于弱监督全切片图像分类,通过注意力条件一致性对齐细胞层不一致场与临床诊断区域,大幅提升定位精度并增强模型可解释性。
研究提出EviOSAHS框架,通过将面部图像分解为7个解剖学查询,结合临床数据,实现阻塞性睡眠呼吸暂停低通气综合征的高灵敏度筛查。在642名受试者中,准确率88.47%,敏感性94.86%,F1分数93.74%,假阴性率5.14%。
研究人员发布了Planktonzilla-17M,这是迄今最大最全面的浮游生物图像数据集,包含1740万张图像,涵盖13种成像系统、602个分类类别。他们发现,使用分类学谱系作为文本的监督分类器在性能上匹配或超越CLIP式训练,而现有生物基础模型(如BioCLIP)在浮游生物识别上表现不佳。
该研究提出了一种任务感知的流式生成框架,通过重新定义流匹配训练范式,学习最优的子采样掩码,从而在图像分类、重建和MRI加速等压缩感知应用中显著提升性能。在CelebA数据集上以5%采样率达到25.17 dB的PSNR,在fastMRI上实现8倍加速重建的29.24 dB,计算开销极小。
本文在Belief-Attention基础上提出Belief2-Attention,利用正交投影中的垂直分量和投影分量,并引入额外内积矩阵增强token相关性,在图像分类和分割任务上验证了有效性。
DefocusTrackerAI是一个基于深度学习的通用框架,可自动检测和定位不同光学配置下的离焦粒子图像。研究比较了Faster R-CNN和YOLOv9,发现YOLOv9在召回率和不确定性方面更优,尤其在高粒子密度下表现突出。该框架适用于散光和非散光图像,并在多种光照条件下有效。已在真实DPT实验(包括荧光和阴影图数据)中验证,可应用于喷雾和液滴追踪等传统DPT之外的任务。预训练模型已公开,结合深度校准可用于三维离焦粒子追踪。
本研究提出了一个多领域红队框架,用于评估医疗领域大语言模型在对抗性和伦理复杂场景下的表现。通过对11个当代模型在690个临床场景的测试,发现平均得分范围0.791-0.984,但高性能模型在安全关键场景中会出现完全失败,且公平性任务中人口统计修改导致10-20%的误差放大。研究强调,性能方差和极端失败比平均准确率更能反映临床可靠性,混合评估方法结合自动化与临床医生监督对安全评估至关重要。
一项新研究结合认知语言特征和DistilBERT嵌入,使用全息约简表示(HRR)检测在线文本中的抑郁症,在Reddit帖子数据集上实现了0.94的宏F1分数,显著优于传统TF-IDF基线的0.80。
大语言模型在长上下文解码时面临内存带宽瓶颈,因为需要频繁访问庞大的键值(KV)缓存。现有方法多在解码前进行基于键的剪枝,但忽视了注意力输出同时依赖键和值。本文提出注意力运行时终止(ART),一种轻量级机制,在内核执行过程中动态跟踪累积的注意力输出,当后续贡献可忽略时提前终止KV块访问。ART与现有基于键的方法正交,可无缝集成。在LongBench基准测试中,大批量下生成吞吐量提升20%,且精度相当。
一项名为TrustLDM的新基准测试,全面评估语言扩散模型在安全性、隐私和公平性方面的可信度。研究发现,虽然模型在仅用户提示下表现良好,但附加上下文中的恶意内容会显著降低其对齐行为。此外,较长的上下文不一定产生更强的影响,解码顺序和生成长度也会影响评估结果。研究还提出了自动评估框架TrustLDM-Auto,系统性地识别脆弱配置。
该系统采用“先生成再择优”策略,通过偏好模型(从人工对比中学习)来筛选幽默候选,在SemEval-2026幽默生成任务中取得英语和中文第一名、西班牙语第二名的成绩。
提出SENSE方法,通过基于目标模型隐藏状态的语义检索和软门控评估,提升检索式推测解码的鲁棒性和效率,在LLaMA和Qwen上实现高达4.09的平均接受长度和3.26倍加速。
提出CSRP三阶段框架,通过持续预训练、链式推理监督微调和基于效率感知奖励的组相对策略优化,有效缓解中文语法纠错中的过度纠正问题。在NACGEC基准上取得SOTA性能,F0.5达50.99,精确率57.17;在CSCD拼写纠正任务中F1达59.61,超过GPT-4 5.20个百分点。
随着语言模型生成文本的流畅度接近人类水平,传统的基于表面统计或似然信号的检测方法已难以应对。AEyeDE提出了一种基于注意力归因的新方法,通过代理Transformer模型提取人类和AI生成文本的注意力矩阵,并使用轻量级卷积神经网络进行区分。实验表明,该方法在多种设置下均表现出色,并具有可解释性和鲁棒性。
提出DOPA框架,通过引入分布外代理近似不可访问的目标领域,并采用马氏距离全局多样性约束,从源领域检索分布相似且多样的演示,增强大语言模型在分布偏移下的鲁棒性。该方法已被ACL 2026接收。
研究人员构建了首个公开的英文多模态多方对话话语解析数据集DraDDP,基于美国电视剧,包含495个对话片段、6374个话语和9.1小时的视频内容。实验表明多模态信息有助于捕捉对话结构和关系类型。数据集、标注指南和代码将公开发布。
本综述提出了一种基于生命周期的主动式检测框架,以应对生成式AI加速产生的对抗性合成内容。通过C5交互模型整合机器学习与社会科学方法,系统回顾了新兴虚假叙事检测技术,包括协调不真实行为分析、流行病学建模和霍克斯过程。讨论了高维嵌入空间异常检测、多层图无监督协调检测及智能体AI系统。最后指出了追踪快速变化威胁和多层级分布漂移的挑战,并规划了未来研究方向。
该论文系统分析了大型语言模型代理中工具调用的有效性和效率问题。在有效性方面,作者发现评估结果对随机种子、系统提示、多轮模板构建等看似微小且常被文档化的实现细节高度敏感,导致排行榜排名不可靠。在效率方面,作者识别出标准强化学习训练中的计算浪费来源,并提出了两种加速技术,在不降低性能的前提下显著缩短训练时间。
本文全面综述了世界模型的研究现状,提出了一个涵盖架构、方法、推理和应用的四维分类法,梳理了从PlaNet到Genie等里程碑系统,并讨论了预测误差、仿真到现实迁移等挑战及未来方向。