HealthCraft 是首个基于 FHIR R4 构建的急诊医学强化学习环境,通过双层级评分系统评估语言模型在复杂临床工作流中的安全性。测试显示,前沿模型在多步工作流中几乎完全失败,且基础设施缺陷会影响模型排名。该环境及任务集已开源。
AI 新闻实时情报
实时监测
实时更新
实时跟踪可信来源,保留出处、权限和站内阅读模式,把噪声压成可读情报。
实时更新
一项模拟研究探讨了在污染数据下过度参数化线性回归中的双重下降现象,发现最小二乘插值法在泛化性能上优于稳健估计器。
GOEN(几何优化认知网络)是一种新的OOD检测方法,结合多尺度特征、L2归一化、马氏距离和校准头,在CIFAR-10上达到0.9483的平均OOD AUROC,超越深度集成等基线。反直觉发现:CenterLoss正则化虽提升分类准确率却显著降低OOD检测性能。
一项新研究证明了在特征共线时,没有特征排序方法能同时满足忠实性、稳定性和完备性。该不可能性定理通过四种模型类量化,并提出了集成平均方法DASH来解决。在77个公共数据集的调查中,68%存在归因不稳定性。该框架还包括实际诊断工具和对公平性审计的影响。
该研究探讨如何让语言模型在实验前预测研究想法是否成功。通过构建基于PapersWithCode的11488个想法对数据集,微调小模型达到77.1%准确率,甚至超过GPT-5。使用强化学习框架RLVR进一步提高可解释性,展示了小模型在科学发现中的潜力。
研究者提出时间对比Transformer(TCT),一种自监督表示学习框架,用于捕捉金融交易序列中的时间动态。实验表明,单独使用TCT嵌入的AUC为0.8644,但结合领域工程特征后性能无提升(AUC 0.9205 vs 0.9245),说明学习到的表示与现有特征高度重叠。该工作表明自监督学习有望减少对特征工程的依赖,但尚需进一步研究。
Mahjax是一个在JAX中实现的完全向量化立直麻将环境,可利用GPU进行大规模并行化,吞吐量达到在8块NVIDIA A100 GPU上每秒200万步(无红宝牌规则)和100万步(有红宝牌规则)。该环境支持从零开始(tabula rasa)的强化学习训练,并附有高质量可视化工具,实验验证了训练智能体可以有效提升排名。
根据经典谈判理论,人们在谈判中的成功取决于平衡共情与自信、关心他人与关心自我、对人温和与对事强硬等竞争需求。然而,人们往往难以管理这些张力,导致研究人员无法在受控条件下严格检验这些理论。AI智能体没有这些限制,其精准性、多样性、一致性和可扩展性使得新型实验成为可能。本文引入“个性工程”方法论,利用AI智能体精确参数化、操纵和评估谈判者个性,并提议使用人际环状模型(温暖与支配两个核心维度)作为基础坐标系。该方法既为检验经典谈判理论提供了严格方法论,也为设计AI谈判智能体的个性提供了实用指南。
本文介绍了AgentAtlas框架,该框架通过四个组成部分来评估LLM智能体:六状态控制决策分类法、九类轨迹失败分类法、分类法感知与盲法比较方法以及基准覆盖审计。实验表明,移除显式标签菜单后,所有模型的轨迹准确率下降14-40个百分点,落在0.54-0.62的狭窄区间,且没有模型在所有指标上获胜。
基准测试对于追踪AI进展很重要,但可能高估或低估实际能力。本文提出“开放世界评估”作为补充:长期、混乱的真实世界任务,通过小样本定性分析进行评估。作者介绍了CRUX项目,并展示AI代理成功开发并发布了一款iOS应用,仅需一次手动干预,表明开放世界评估能提供早期预警。
在高风险自动化决策中,预测不确定性对用户接受或拒绝预测至关重要。当前不确定性增强(UA)系统的评估方法存在不足,本文提出ECUAS_n度量族,将其表述为适当评分规则,参数n控制错误预测成本与不完美不确定性之间的权衡。实验证明其优势。
本文介绍了几种生成高质量嵌入的方法,以提升神经网络在Horn逻辑推理中对选择进行排序的效率。通过三元组损失训练,并引入三种新思路:生成更可能包含重复项的锚点、平衡正负例的难易程度、以及在训练中周期性强调最难样例。实验表明这些方法能提高下游推理任务的性能。
AgentCo-op是一种新型检索驱动合成框架,通过类型化工件传递组合可复用技能、工具和外部智能体,并在执行失败时进行局部修复。在空间转录组学和单细胞多组学等开放世界基因组学案例中,它无需重新设计即可协调独立开发的智能体和工具库,在六个基准测试中四个取得最优结果,并持续降低任务成本。
一种名为OSCToM的新方法利用强化学习生成对抗样本,测试大语言模型的心智理论,在FANToM基准上达到76%准确率,效率提升6倍。
提出COSMO-Agent框架,通过工具增强的强化学习教授LLM完成闭环CAD-CAE过程,解决工业设计仿真中的语义鸿沟问题。实验证明小规模开源模型在可行性、效率和稳定性上超越大模型。
大型语言模型在动态真实环境中面临概念漂移和高成本梯度适配的瓶颈。本文提出SOLAR,一种自我优化的终身自主推理器,通过参数级元学习和多级强化学习实现持续适应,无需人工标注。SOLAR维护演化知识库平衡可塑性与稳定性,在常识、数学、医疗、编程、社会和逻辑推理任务上超越强基线,标志着迈向终身自适应智能体的重要一步。
EvoScene-VLA是一种新的视觉-语言-动作(VLA)策略,它在动作解码器内部维护一个持续更新的场景信念,以解决分块机器人控制中因动作导致的场景变化问题。在31个RoboTwin任务和Galaxea R1-Lite真实机器人上,该方法显著提升了任务成功率。
本文对一种新型线性软套管执行器(LSSA)进行了解析和实验力分析。建立了准静态模型,通过实验验证了在125 kPa压力下出力随伸长从约112 N降至零,且静态载荷会延迟并减小出力。结果表明LSSA的力生成受压力、几何形状、位移、载荷和轴向刚度的耦合影响。
本研究提出一种基于汉密尔顿规则的异质多团队协作资源分配框架,通过动态机器人分配实现团队间利他协作。该问题被证明是NP难的,为此开发了图神经网络策略进行近似优化,在消防场景的仿真和实验中验证了其接近最优的性能和可扩展性。
本文提出一种自适应覆盖策略,通过实时环境模型反馈调整机器人采样行为,提升未知环境中的遍历搜索效率。
PGDG是一种新颖的数据生成框架,能够从单次演示中扩展出物理上合理、多样化的恢复行为数据集,无需额外人工标注。它通过物理采样子和数据策展器迭代优化,在双臂操作任务中显著优于传统空间增强方法,并支持GR00T等基础模型的微调。
该论文研究了微重力环境中多肢机器人的抓取动态运动,提出了参数化运动规划框架,并通过模拟评估了步态模式、步长、速度和姿态等设计参数的影响。结果表明,扩大接触反力空间和抑制脉冲式全身动力学可提升运动性能。
研究人员提出了一种闭环模拟到现实强化学习方法,用于控制微纤维在表面上的形状。该方法在简化的无摩擦模拟器中训练策略,并在实际部署中利用实时视觉反馈校正未建模的表面相互作用。使用丝质微纤维进行测试,在24种不同初始配置下实现了平均270微米的形状误差,并在多种纤维直径和长度下保持亚毫米精度,无需重新训练或调整。
本文提出一种用于无人机蜂群的分布式多覆盖算法,无需全局协调,仅依靠局部感知和通信即可确保每个关键资产被多台机器人冗余覆盖,且能应对机器人故障。该工作被ANTS 2026会议录用。
一种基于虚拟现实(VR)的共享控制框架,用于未知环境中的无人机团队,通过用户引导的运动基元规划器和导纳控制器实现实时避障,实验表明可降低操作员负担并提高导航性能。
BEiTScore是一种基于轻量级交叉编码器的无参考图像描述评估指标,从视觉问答模型初始化,结合对抗性LLM数据增强,在保持高效性的同时实现了最先进的性能。
AVI-HT是一种自适应视觉-IMU融合方法,通过联合建模第一人称视角图像和手套上的6自由度IMU信号实现3D手部姿态追踪。在严重视觉遮挡的手-物交互场景中,AVI-HT显著提升了精度和可用性。其核心在于同步多模态训练数据和跨传感器深度注意力机制。在DexGloveHOI数据集上的实验表明,AVI-HT将平均关键点误差降低了16.1%,手腕对齐变体降低了24.2%。
MRecover是一种条件生成模型,通过将常规采集的T1w图像合成为TSE图像,并采用自回归切片条件化确保体积一致性,从而恢复运动伪影损坏的MR图像。该模型在7T MRI数据上训练(n=577),在域内测试中表现高保真度(SSIM=0.84,FSIM=0.94),并良好泛化至3T数据。在ADNI3数据集中,经质量控制后,可分析受试者增加了31.8%(593 vs 450),并提高了海马亚区萎缩诊断组间差异的效应量。
现有视觉语言模型在超声图像问答中表现欠佳,因为它们无法模拟超声技师主动聚焦病灶的认知过程,且忽略了标注的主观性。本文提出一种框架,引入“缩放-诊断”范式和基于不确定性的奖励机制,在GRPO框架下鼓励模型对清晰病例增强准确预测,对模糊病例保持谨慎。在肝脏、乳腺和甲状腺数据集上,病灶定位准确率提升39.3%。
本文提出“消融验证”诊断原则及其具体实现——标记替换测试(TRT),用于检验视觉语言模型(VLM)是否真正利用连续潜在标记进行推理。实验表明,即使标记内容被破坏或替换,VLM仍保留大部分性能提升,准确率提升并不能证明模型使用了这些标记进行推理。