论文提出四种利用足地接触减少IMU漂移的腿式机器人状态估计器,包括接触辅助不变扩展卡尔曼滤波器、因子图、固定滞后平滑器等,并已在GTSAM和ROS2中开源实现。
AI 新闻实时情报
实时监测
实时更新
实时跟踪可信来源,保留出处、权限和站内阅读模式,把噪声压成可读情报。
实时更新
本文提出UfM*算法,通过紧凑高斯混合模型高效衡量多视图不一致性,仅需单次深度神经网络推理即可实现可靠的不确定性估计,在能耗和内存上远优于传统集成方法,适用于资源受限的机器人系统。
本文介绍了PIMbot框架,该框架通过奖励通道激励操控和智能体自身策略操控两种互补手段,对多机器人强化学习环境进行对抗性操控。自适应多目标控制器在线平衡这些手段。实验在Gazebo仿真环境和NVIDIA Jetson Orin Nano真实嵌入式设备上验证了效果,PIMbot可作为多机器人协作任务漏洞的严格压力测试工具。
研究人员提出一种方法,在关节限制下认证可达笛卡尔步长,在对抗场景中实现零违规和100%目标到达。
机器人从演示中学习奖励函数时,演示常常不完善,导致某些重要特征(即任务相关行为方面)未被充分指定,从而在部署时出现行为错位。本文提出一种框架,通过分析演示中特征值的变异性来检测未充分指定的特征(变异小表示指定良好,变异大表示指定不足)。机器人随后用自然语言解释其不确定的特征,并主动请求针对性的纠正演示。在模拟桌面操作和真实Franka机器人用户研究中,定向解释引导的查询显著优于随机查询和被动数据收集。
Agentic-VLA提出了一种智能体训练框架,通过自适应奖励合成、语言引导探索和经验记忆三大创新,使VLA模型能够在部署中高效在线自适应。在LIBERO基准测试中,长时任务提升12.3%,单样本学习提升28.5%,跨任务迁移从0%提升至31.2%,收敛速度提升2.4倍。在RoboTwin 2.0双机械臂基准上也保持优势。
事件相机凭借低延迟、高时间分辨率和高动态范围,在高速运动和复杂光照条件下的视觉里程计任务中表现优异。深度事件视觉里程计(DEVO)通过结合稀疏补丁跟踪、学习补丁选择、循环对应优化和可微分光束法平差,实现了强大的单目事件里程计性能。本研究在DEVO基础上添加了稀疏点云导出管道,无需修改核心里程计算法,即可将内部估计的3D结构转换为显式点云表示,支持可视化和后续处理。实验表明,导出的稀疏点云在局部与EMVS重建一致,在5厘米阈值下精度高,但也暴露了密度、完整性和对累积里程计噪声敏感等局限性。
本系统综述评估了远程遥操作血管内介入机器人的技术可行性、通信基础设施和临床结局。在2501篇初始文献中纳入16项研究,发现机械或电磁驱动的遥操作导管和导丝可在长达7000公里的距离内导航,网络延迟控制在30-163毫秒的临床可接受范围内。小规模人体试验显示100%的手术成功率,但多数证据来自动物或模型研究。综述指出,该技术有望减少辐射暴露、扩大患者就医机会,并优化资源分配。未来需在低收入国家开展研究,并进行多中心临床试验以验证安全性和有效性。
利用毫米波雷达实现无需脱衣的快速全身测量,保护隐私,适用于临床和护理机构。
本文提出一种以运动为核心模态的视频表示学习方法TIME(时间感知运动嵌入),通过掩码自编码器在点轨迹上进行自监督学习,仅使用合成运动数据训练,在多种零样本任务上达到与使用多四个数量级数据的SOTA模型相当的性能。
CoMoGen是一种可控视频生成框架,通过输入图像的二进制掩码序列生成逼真的交互动态。它引入轻量级MaskAdapter将掩码编码为潜在残差信号,并通过余弦加权调度注入多模态扩散变换器(MMDiT)。通过在MMDiT注意力空间中识别“运动层”,并仅对运动层使用低秩适配(LoRA)进行微调,CoMoGen在不改变架构的情况下降低了计算成本。实验表明,CoMoGen在运动保真度和感知真实感方面达到了最先进水平。
视频记录儿童与照顾者的互动有助于研究自然行为中的注意力动态,但手动注释耗时。GBAT是一个基于深度学习的工具包,可自动执行视频同步、注视目标注释和姿势/手部动作分类,提高大规模发育研究的效率。
本文介绍了一种对DETR融合变换器基线的轻量级修改,用于MaCVi 2026视觉到航标数据关联挑战。该方法训练了一个专用MLP(QueryMLP),从海图测量和IMU姿态数据显式预测浮标的水线接触点的像素坐标,并将其附加到基线解码器查询向量中,为每个浮标提供直接的空间先验,减轻变换器解码器的几何推理负担。在挑战赛排行榜上,该方法在保留测试集上取得了0.7386的总分,F1为0.8055,mIoU为0.6718,在所有提交中排名第二。
VideoOdyssey是一个专为超长时间上下文和全模态视频理解设计的基准,平均视频时长109分钟,覆盖11个领域54个子类别,通过连续证书长度衡量认知负荷,并设有5个粒度级别。评估表明当前多模态大模型在持续推理、细粒度感知和非语言全模态理解方面存在瓶颈。
该研究质疑视觉语言模型(VLM)在基准测试中的高分是否真正反映其视觉理解能力。实验发现,移除大量图像令牌仅轻微降低模型性能,表明模型对细粒度视觉证据的敏感性不足。通过全局退化、局部遮挡、问题改写、答案空间扩展及决策层分析,结合层视觉令牌几何分析,研究者揭示模型预测在内部支持减弱时仍可能保持不变,且视觉令牌在深层中趋于相似。结论是当前基准无法可靠评估VLM的细粒度视觉基础。
GEM-4D是一种几何增强的视频世界模型,通过注入密集的4D对应监督来提升机器人的操作能力。该模型在训练时从预训练的几何基础模型中提取知识,从而同时捕捉外观和几何结构,且不增加推理成本。此外,引入逆向动力学模块,将一致的视频序列转化为可执行的机器人轨迹。实验显示,GEM-4D在视频预测和几何一致性上达到最优,并将真实世界操作成功率从61%提升至81%。
一项新研究发现,大型语言模型(LLMs)在回答宗教转换问题时表现出持续的非对称性。模型倾向于支持加入天主教、巴哈伊教和锡克教,同时劝阻放弃这些信仰,而对无神论者、不可知论者和耶和华见证人则相反。该研究测试了20个模型在182对宗教配对中的表现,结果具有可重复性。研究使用人类验证的“LLM作为法官”框架,发现所有模型均显示非对称性,其中Grok 4.20最为显著。这些偏差如果大规模部署可能产生现实影响。
研究评估了七个大型语言模型(包括Gemini、Claude和GPT系列)从长期Slack日志中推断个人领域知识的能力。分析27,188条来自43名用户的消息,对比零样本估计与27名参与者的自我报告技能评分。Gemini 2.5 Flash表现最佳(MAE 21.13%),而GPT模型误差较大。研究发现,估计准确性仅微弱依赖于消息数量,表明更多文本并不能保证更好的推断。该结果展示了自动专业知识映射的可行性和当前局限性,强调需要隐私保护部署和更丰富的结构感知知识表示。
大型语言模型(LLM)优化于生成分布上合理的续接,而非明确验证生成命题是否源于源文档。这一归纳偏置促进了泛化,但未编码响应是否相对于参考文本接地。现有幻觉检测方法通过检索增强、自一致性或声明验证改善事实性,但通常不直接学习对齐拓扑。本文构建参考信息与LLM输出之间的对齐二分图,并训练图神经网络(GNN)通过消息传递建模对齐结构。该方法在四个不同的幻觉和问答数据集上取得了最先进的结果,优于包括GPT-4o在内的所有比较方法。
为提高扩散语言模型(DLM)的推理能力,研究人员提出LIFT算法,通过感知不同时间步的信息可学习性来优化微调过程,在六个推理基准上超越现有方法,并在AIME'24和AIME'25上取得高达3倍的相对提升。
本研究提出一种红队测试框架,用于评估开源大型语言模型在政治争议话题上的表达范围(Overton Window),并量化简单自然语言越狱如何扩展该范围。研究发现,开源模型普遍更倾向于生成左倾内容,Overton Window随模型规模增大而收缩,且存在显著的地区差异。越狱效果在不同模型家族间差异明显,该框架有助于审计模型的政治可控性并设计更强的防御措施。
本文提出一种知识感知的Text-to-SQL框架,通过构建任务特定的知识库(包括模式语义、缩写、业务逻辑和查询模式),并注入训练和推理过程,在低资源领域显著提升模型性能。实验在七个基准上验证了其对开源和闭源大语言模型的改进。
本调查系统梳理了豪萨语(约8000万-1亿母语者)和丰贝语(贝宁约200万人使用)的公开文本与语音资源。研究发现豪萨语在新闻、百科和教育领域拥有更丰富的文本资源,而丰贝语尽管文本资源有限,但近年学术语音数据收集项目有所增长。两种语言均被纳入Masakhane基准测试。报告提出了任务特定建议,并指出了关键缺口,如丰贝语领域多样化文本和豪萨语专用语音库。
张量缓存是一种两层级缓存架构,结合滑动窗口注意力作为一级缓存(L1)和固定大小的外积快速权重记忆作为二级缓存(L2),L2由窗口驱逐的KV对填充。该方法通过线性注意力恒等式实现高效读取,并引入可学习的门控融合L1和L2输出。实验表明,张量缓存在记忆-质量边界上优于有状态基线。
现有神经求解器在处理多目标组合优化问题时,通常采用基于分解的策略,将问题转化为多个与权重向量相关的子问题。然而,这些方法往往仅在解码阶段注入一次权重,限制了权重条件上下文建模,或者主要在编码阶段注入,导致解码时权重信号稀释。此外,偏好优化方法依赖纯随机采样构建解对,训练效率低下。为此,本文提出WeCon,一种高效的权重条件神经网络求解器,通过门控残差融合(GRF)和残差融合(RF)模块增强权重与实例特征的交互,并引入高效偏好优化(EPO)构建高质量解对。实验表明,WeCon在超体积(HV)指标上与最先进的POCCO-W相当,同时推理时间减少40%。
研究表明,链式思维推理并非总是有益,早期熵动力学可用于判断何时需要推理。作者提出EDRM框架,通过熵轨迹自适应选择推理策略,在15个基准测试和4个模型上实现41-55%的token减少同时提升准确率。
MedExpMem是一种新型经验记忆框架,使医学视觉语言模型能够从诊断失败中积累鉴别诊断经验。在11个放射学专业领域实现高达7%的准确率提升。
本文提出 ManiF-SMC 方法,通过将擦除样本从原始流形表示质心推向保留数据中的最近语义邻居,在表示空间内实现近似机器遗忘,减少了对标签和梯度的依赖。自模式连通模块自适应生成边距,实验表明遗忘效果与现有方法相当。
研究发现,小语言模型在进行算术推理时,思维链(CoT)提示的步骤顺序并不重要,模型实际上是通过复制答案分隔符前的最后一个数字来得出答案,而非依赖逻辑推理。这种位置性捷径占模型准确率的绝大部分,且即使中间推理正确,错误的尾数也会导致答案错误。不同模型表现有差异,但该现象普遍存在,对基于CoT的监督方法提出了挑战。
FuRA是一种新型全秩参数高效微调方法,通过谱预条件保留预训练的稳健特征,在LLM和VLM微调中超越全参数微调和LoRA,其4位量化变体QFuRA也优于QLoRA。