AI News HubLIVE

AI 新闻实时情报

实时监测

今天 AI 世界最重要的变化

来自 105 个可信来源,最近更新 2026-05-22 12:00 UTC+8。

实时监测

实时更新

实时跟踪可信来源,保留出处、权限和站内阅读模式,把噪声压成可读情报。

实时更新

重置
HealthCraft:面向急诊医学的强化学习安全环境

HealthCraft 是首个基于 FHIR R4 构建的急诊医学强化学习环境,通过双层级评分系统评估语言模型在复杂临床工作流中的安全性。测试显示,前沿模型在多步工作流中几乎完全失败,且基础设施缺陷会影响模型排名。该环境及任务集已开源。

arXiv Machine Learning模型 / Agent / 政策站内正文
归因不可能:共线性下无特征排序能同时满足忠实性、稳定性和完备性

一项新研究证明了在特征共线时,没有特征排序方法能同时满足忠实性、稳定性和完备性。该不可能性定理通过四种模型类量化,并提出了集成平均方法DASH来解决。在77个公共数据集的调查中,68%存在归因不稳定性。该框架还包括实际诊断工具和对公平性审计的影响。

arXiv Machine LearningAgent / 研究站内正文
教语言模型通过比较想法预测研究成功

该研究探讨如何让语言模型在实验前预测研究想法是否成功。通过构建基于PapersWithCode的11488个想法对数据集,微调小模型达到77.1%准确率,甚至超过GPT-5。使用强化学习框架RLVR进一步提高可解释性,展示了小模型在科学发现中的潜力。

arXiv Machine Learning模型 / 研究 / 创业融资站内正文
时间对比Transformer用于金融犯罪检测:通过预测对比编码实现自监督序列嵌入

研究者提出时间对比Transformer(TCT),一种自监督表示学习框架,用于捕捉金融交易序列中的时间动态。实验表明,单独使用TCT嵌入的AUC为0.8644,但结合领域工程特征后性能无提升(AUC 0.9205 vs 0.9245),说明学习到的表示与现有特征高度重叠。该工作表明自监督学习有望减少对特征工程的依赖,但尚需进一步研究。

arXiv Machine Learning模型 / 研究站内正文
Mahjax:一个用于JAX中强化学习的高性能GPU加速麻将模拟器

Mahjax是一个在JAX中实现的完全向量化立直麻将环境,可利用GPU进行大规模并行化,吞吐量达到在8块NVIDIA A100 GPU上每秒200万步(无红宝牌规则)和100万步(有红宝牌规则)。该环境支持从零开始(tabula rasa)的强化学习训练,并附有高质量可视化工具,实验验证了训练智能体可以有效提升排名。

arXiv AI模型 / Agent / 芯片站内正文
利用AI智能体进行个性工程:谈判研究的新方法论

根据经典谈判理论,人们在谈判中的成功取决于平衡共情与自信、关心他人与关心自我、对人温和与对事强硬等竞争需求。然而,人们往往难以管理这些张力,导致研究人员无法在受控条件下严格检验这些理论。AI智能体没有这些限制,其精准性、多样性、一致性和可扩展性使得新型实验成为可能。本文引入“个性工程”方法论,利用AI智能体精确参数化、操纵和评估谈判者个性,并提议使用人际环状模型(温暖与支配两个核心维度)作为基础坐标系。该方法既为检验经典谈判理论提供了严格方法论,也为设计AI谈判智能体的个性提供了实用指南。

arXiv AIAgent / 研究站内正文
AgentAtlas:超越LLM智能体的结果排行榜

本文介绍了AgentAtlas框架,该框架通过四个组成部分来评估LLM智能体:六状态控制决策分类法、九类轨迹失败分类法、分类法感知与盲法比较方法以及基准覆盖审计。实验表明,移除显式标签菜单后,所有模型的轨迹准确率下降14-40个百分点,落在0.54-0.62的狭窄区间,且没有模型在所有指标上获胜。

arXiv AI模型 / Agent / 政策站内正文
衡量前沿AI能力的开放世界评估

基准测试对于追踪AI进展很重要,但可能高估或低估实际能力。本文提出“开放世界评估”作为补充:长期、混乱的真实世界任务,通过小样本定性分析进行评估。作者介绍了CRUX项目,并展示AI代理成功开发并发布了一款iOS应用,仅需一次手动干预,表明开放世界评估能提供早期预警。

arXiv AIAgent / 研究 / 创业融资站内正文
$ECUAS_n$:一种用于原则性评估不确定性增强系统的度量族

在高风险自动化决策中,预测不确定性对用户接受或拒绝预测至关重要。当前不确定性增强(UA)系统的评估方法存在不足,本文提出ECUAS_n度量族,将其表述为适当评分规则,参数n控制错误预测成本与不完美不确定性之间的权衡。实验证明其优势。

arXiv AI研究 / 创业融资站内正文
用于Horn逻辑推理的高质量嵌入

本文介绍了几种生成高质量嵌入的方法,以提升神经网络在Horn逻辑推理中对选择进行排序的效率。通过三元组损失训练,并引入三种新思路:生成更可能包含重复项的锚点、平衡正负例的难易程度、以及在训练中周期性强调最难样例。实验表明这些方法能提高下游推理任务的性能。

arXiv AI模型 / 研究站内正文
AgentCo-op:基于检索的可互操作多智能体工作流合成框架

AgentCo-op是一种新型检索驱动合成框架,通过类型化工件传递组合可复用技能、工具和外部智能体,并在执行失败时进行局部修复。在空间转录组学和单细胞多组学等开放世界基因组学案例中,它无需重新设计即可协调独立开发的智能体和工具库,在六个基准测试中四个取得最优结果,并持续降低任务成本。

arXiv AIAgent / 研究 / 创业融资站内正文
用于闭环优化、仿真与建模编排的工具增强型代理

提出COSMO-Agent框架,通过工具增强的强化学习教授LLM完成闭环CAD-CAE过程,解决工业设计仿真中的语义鸿沟问题。实验证明小规模开源模型在可行性、效率和稳定性上超越大模型。

arXiv AI模型 / Agent / 研究站内正文
SOLAR:面向终身学习与持续适应的自我优化开放式自主智能体

大型语言模型在动态真实环境中面临概念漂移和高成本梯度适配的瓶颈。本文提出SOLAR,一种自我优化的终身自主推理器,通过参数级元学习和多级强化学习实现持续适应,无需人工标注。SOLAR维护演化知识库平衡可塑性与稳定性,在常识、数学、医疗、编程、社会和逻辑推理任务上超越强基线,标志着迈向终身自适应智能体的重要一步。

arXiv AI模型 / Agent / 研究站内正文
EvoScene-VLA:在动作解码器内部演化场景信念以支持分块机器人控制

EvoScene-VLA是一种新的视觉-语言-动作(VLA)策略,它在动作解码器内部维护一个持续更新的场景信念,以解决分块机器人控制中因动作导致的场景变化问题。在31个RoboTwin任务和Galaxea R1-Lite真实机器人上,该方法显著提升了任务成功率。

arXiv Robotics模型 / 政策 / 研究站内正文
软体线性气动执行器的解析与实验力分析

本文对一种新型线性软套管执行器(LSSA)进行了解析和实验力分析。建立了准静态模型,通过实验验证了在125 kPa压力下出力随伸长从约112 N降至零,且静态载荷会延迟并减小出力。结果表明LSSA的力生成受压力、几何形状、位移、载荷和轴向刚度的耦合影响。

arXiv Robotics研究 / 机器人站内正文
异质多团队系统中的利他协作学习

本研究提出一种基于汉密尔顿规则的异质多团队协作资源分配框架,通过动态机器人分配实现团队间利他协作。该问题被证明是NP难的,为此开发了图神经网络策略进行近似优化,在消防场景的仿真和实验中验证了其接近最优的性能和可扩展性。

arXiv RoboticsAgent / 政策站内正文
PGDG: 基于物理的数据生成用于从单次演示中实现鲁棒双臂策略学习

PGDG是一种新颖的数据生成框架,能够从单次演示中扩展出物理上合理、多样化的恢复行为数据集,无需额外人工标注。它通过物理采样子和数据策展器迭代优化,在双臂操作任务中显著优于传统空间增强方法,并支持GR00T等基础模型的微调。

arXiv Robotics模型 / 政策 / 研究站内正文
微重力下基于抓取的动态运动设计

该论文研究了微重力环境中多肢机器人的抓取动态运动,提出了参数化运动规划框架,并通过模拟评估了步态模式、步长、速度和姿态等设计参数的影响。结果表明,扩大接触反力空间和抑制脉冲式全身动力学可提升运动性能。

arXiv Robotics政策 / 研究 / 创业融资站内正文
可变形微纤维形状控制的闭环模拟到现实强化学习

研究人员提出了一种闭环模拟到现实强化学习方法,用于控制微纤维在表面上的形状。该方法在简化的无摩擦模拟器中训练策略,并在实际部署中利用实时视觉反馈校正未建模的表面相互作用。使用丝质微纤维进行测试,在24种不同初始配置下实现了平均270微米的形状误差,并在多种纤维直径和长度下保持亚毫米精度,无需重新训练或调整。

arXiv Robotics政策 / 研究站内正文
分布式多覆盖:面向机器人蜂群的鲁棒覆盖算法

本文提出一种用于无人机蜂群的分布式多覆盖算法,无需全局协调,仅依靠局部感知和通信即可确保每个关键资产被多台机器人冗余覆盖,且能应对机器人故障。该工作被ANTS 2026会议录用。

arXiv Robotics研究 / 机器人站内正文
AVI-HT:自适应视觉-IMU融合三维手部追踪

AVI-HT是一种自适应视觉-IMU融合方法,通过联合建模第一人称视角图像和手套上的6自由度IMU信号实现3D手部姿态追踪。在严重视觉遮挡的手-物交互场景中,AVI-HT显著提升了精度和可用性。其核心在于同步多模态训练数据和跨传感器深度注意力机制。在DexGloveHOI数据集上的实验表明,AVI-HT将平均关键点误差降低了16.1%,手腕对齐变体降低了24.2%。

arXiv Computer Vision研究 / 机器人站内正文
MRecover:一种利用AI生成对比度恢复运动伪影MR图像的条件生成模型

MRecover是一种条件生成模型,通过将常规采集的T1w图像合成为TSE图像,并采用自回归切片条件化确保体积一致性,从而恢复运动伪影损坏的MR图像。该模型在7T MRI数据上训练(n=577),在域内测试中表现高保真度(SSIM=0.84,FSIM=0.94),并良好泛化至3T数据。在ADNI3数据集中,经质量控制后,可分析受试者增加了31.8%(593 vs 450),并提高了海马亚区萎缩诊断组间差异的效应量。

arXiv Computer Vision模型 / 研究 / 创业融资站内正文
先聚焦再诊断:通过主动缩放实现置信度感知的超声VQA

现有视觉语言模型在超声图像问答中表现欠佳,因为它们无法模拟超声技师主动聚焦病灶的认知过程,且忽略了标注的主观性。本文提出一种框架,引入“缩放-诊断”范式和基于不确定性的奖励机制,在GRPO框架下鼓励模型对清晰病例增强准确预测,对模糊病例保持谨慎。在肝脏、乳腺和甲状腺数据集上,病灶定位准确率提升39.3%。

arXiv Computer Vision模型 / Agent / 政策站内正文
消融验证:视觉语言模型真的在使用连续思维标记吗?

本文提出“消融验证”诊断原则及其具体实现——标记替换测试(TRT),用于检验视觉语言模型(VLM)是否真正利用连续潜在标记进行推理。实验表明,即使标记内容被破坏或替换,VLM仍保留大部分性能提升,准确率提升并不能证明模型使用了这些标记进行推理。

arXiv Computer Vision模型 / 研究站内正文