AI News HubLIVE

AI 新闻实时情报

实时监测

今天 AI 世界最重要的变化

来自 105 个可信来源,最近更新 2026-05-15 12:00 UTC+8。

实时监测

实时更新

实时跟踪可信来源,保留出处、权限和站内阅读模式,把噪声压成可读情报。

实时更新

重置
面向法律探究型对话智能体的双重层次对话策略学习

本文提出探究型对话智能体(ICA)概念,并针对美国最高法院口头辩论场景开发了基于双重层次强化学习的框架。该框架通过两个协作的强化学习代理分别管理战略对话和细粒度语句生成,模拟法官提问模式以主动获取关键法律信息。在最高法院数据集上的评估表明,该方法在多项指标上优于基线模型,为高风险领域专业应用迈出第一步。

arXiv Computational LinguisticsAgent / 政策 / 研究站内正文
PEML:基于优化连续提示的参数高效多任务学习

本文提出了一种名为PEML的参数高效多任务学习方法,通过神经架构工程优化连续提示,并结合低秩模型权重适应,在GLUE、SuperGLUE等基准测试中平均准确率提升高达6.67%,单个任务最高提升10.75%。

arXiv Computational Linguistics模型 / 研究 / 创业融资站内正文
推导提示:一种基于逻辑的改进检索增强生成的方法

研究人员提出了一种名为“推导提示”的新型提示技术,用于检索增强生成(RAG)框架的生成步骤。该方法受逻辑推导启发,通过系统应用预定义规则从初始假设中推导结论,构建可解释的推导树,从而减少知识密集型任务中的幻觉和错误推理。案例研究表明,与传统RAG和长上下文窗口方法相比,该方法显著减少了不可接受的答案。

arXiv Computational Linguistics模型 / 研究站内正文
Physics-R1:经过审计的奥林匹克物理语料库及视觉物理推理配方

本研究对多模态物理评估流程进行了全面审计,发现了三种未被察觉的构建偏差:训练-测试污染、翻译漂移和多项选择题(MCQ)饱和。研究团队发布了四个新数据集和一个基于Qwen3-VL-8B-Thinking的参考模型Physics-R1,在多个基准测试上取得了显著提升。

arXiv Computational Linguistics模型 / 政策 / 研究站内正文
Mistletoe:针对推测解码的隐蔽加速崩溃攻击

研究人员提出了一种名为Mistletoe的新型攻击方法,利用推测解码中草稿模型与目标模型之间的近似误差,通过优化降级目标和语义保持目标,并采用零空间投影机制,大幅降低推测解码的接受长度,从而崩溃加速效果,同时保持输出质量。

arXiv Computational Linguistics模型 / 研究站内正文
VectraYX-Nano:一个4200万参数的西班牙语网络安全语言模型,具备课程学习和原生工具调用能力

研究人员提出了VectraYX-Nano,一个从零开始用西班牙语训练的4200万参数解码器专用语言模型,专为网络安全设计,并通过模型上下文协议(MCP)实现原生工具调用。该模型使用1.7亿tokens的语料库和带有重放缓冲区的课程学习,实现了单调损失下降和0.78的对话门控值。它是首个具备端到端MCP集成的西班牙语原生网络安全LLM,可在普通硬件上亚秒级运行。

arXiv Computational Linguistics模型 / Agent / 研究站内正文
多语言知识编辑的大语言模型合并方法:一项实证探索

该论文系统评估了六种向量合并方法在多语言知识编辑(MKE)中的效果,发现带共享协方差的向量求和是最可靠的策略,而简单求和表现不佳。TSVM可在某些设置下改进性能,但缓解多语言干扰的能力有限。性能对权重缩放因子和秩压缩比敏感,较大的缩放因子和较低的秩通常带来更好结果。

arXiv Computational Linguistics模型 / 研究站内正文
Collider-Bench:用粒子物理分析复现来基准测试AI智能体

Collider-Bench是一个新基准,用于评估大型语言模型(LLM)智能体能否仅凭公开论文和开源软件复现大型强子对撞机(LHC)的实验分析。智能体需构建模拟与选择流水线,并预测指定信号区间的碰撞事件产额。评估采用直方图指标和LLM裁判检测失败模式。初步结果显示,尚无智能体能可靠击败人类物理学家。

arXiv Machine Learning模型 / Agent / 研究站内正文
加权对比学习的统一几何框架

本研究提出将加权InfoNCE目标解释为距离几何问题,为加权对比学习提供了统一的几何框架。在监督分类中,SupCon和Soft SupCon将同类样本收缩到单一原型,但类别不平衡会破坏SupCon的对称性,而Soft SupCon仍保持正则单形体几何。在连续标签设置中,y-Aware CL通常无法达到熵最优,除非标签位于超球面上。几何一致的权重选择(如欧几里得-欧几里得权重或X-CLR)则能保证唯一最优嵌入。

arXiv Machine Learning模型 / 研究站内正文
EMA:面向学习型系统的高效模型适配方法

EMAF系统是首个支持学习型系统在动态环境中以最小开销进行模型适配的方案。通过状态变换器实现跨环境状态对齐,并采用高效用数据优先标注策略,EMA在八个代表性系统上降低了14.9%-42.4%的适配成本(如GPU训练时间),同时将系统性能(如网络吞吐量)提升了6.9%-31.3%。

arXiv Machine Learning模型 / 芯片 / 研究站内正文
超越模式寻求强化学习:扩散语言模型的轨迹平衡后训练

现有扩散语言模型后训练方法多采用奖励最大化目标,导致轨迹锁定问题,即概率质量过度集中于少数去噪路径,降低了重复采样时对正确解的覆盖。本文提出TraFL(轨迹流平衡),通过轨迹平衡目标将策略训练至奖励倾斜的分布,并锚定到冻结参考模型,结合扩散兼容的序列级替代和学习提示相关归一化。在数学推理和代码生成基准上,TraFL是唯一在所有设置中均优于基础模型的方法,且改进随采样预算增加而持续,并泛化至留出评估。

arXiv Machine Learning模型 / 政策 / 研究站内正文
通过混合潜在空间建模无监督学习结构连接组中的采集变异性

研究提出了一种无监督框架,通过架构退火技术移除手动容量调整,使模型能够自适应平衡离散和连续潜在变量,从而有效分离dMRI结构连接组中的采集相关变异与生物学变异。在包含7,416个结构连接组(涵盖2-102岁、13项研究、25种采集参数组合)的数据集上评估,架构退火方法在站点学习方面优于标准VAE、PCA及仅通过损失函数退火的混合模型(ARI=0.53,p<0.05)。

arXiv Machine Learning研究站内正文
通过目标感知源选择重新思考分子分布外泛化

研究人员提出了SCOPE-BENCH,一种新的基准测试,用于评估极端分布外条件下的分子性质预测,以及POMA框架,它利用强化学习选择最优源骨架进行域适应。结果表明,现有模型在新基准上的误差增加高达8倍,而POMA将误差降低了最多11.2%。

arXiv Machine Learning政策 / 研究站内正文
基于稀疏自编码器的脑电图基础模型机械可解释性研究

本研究应用TopK稀疏自编码器对三种不同架构的脑电图变形器(SleepFM、REVE、LaBraM)进行机械可解释性分析,提取特征词典,并通过临床分类法(异常、年龄、性别、药物)评估单一语义性和纠缠性。引入概念引导和“目标vs脱靶”探针区域度量,揭示三种操作模式:可选择引导、编码但纠缠、未编码。暴露关键表征失败如“破坏球”干预和年龄-病理混杂。频谱解码器将潜在操作映射到生理可解释的频率特征。

arXiv Machine Learning模型 / 研究站内正文
基于语义潜在表示的可变规约视觉运行时监控

本文研究在部分可观测条件下基于视觉观测的过去时间信号时序逻辑(ptSTL)的认证运行时监控。监控器需从图像中推断安全相关量并提供有限样本保证,同时要求可复用性。提出语义基础(原子鲁棒性分数向量)作为最小预测目标,单次共形校准即可认证整个片段。还提出滚动预测监控器,在短时域上表现更好,而语义基础监控器在长时域上紧度高达4倍。在Waymo数据上验证了有效性。

arXiv Machine Learning政策 / 研究 / 机器人站内正文
大型学习模型中增强且高效的推理能力

当前大型语言模型虽能生成流畅文本,但缺乏对其内容准确性的可靠保证。传统观点认为增加原则性推理计算成本过高。本文提出一种高效的推理方法,通过将数据重新编码为更明确表示对象间关系的Unary Relational Integracode,再结合标准但精简的机器学习过程,使关系规则的学习在多项式时间内可解,同时保留了现有软硬件基础。该方法可视为实现世界模型,并适用于视觉、行动等多模态场景。

arXiv AI模型 / 研究站内正文
从描述性到规范性:揭示基于LLM的智能体的社会价值对齐

本文提出了一种基于价值的框架,利用GraphRAG将原则转化为价值导向的指令,并通过在具体对话上下文中检索合适指令来引导智能体行为。基于马斯洛需求层次理论和普拉奇克情绪轮的预期行为定义,实验表明该方法在DAILYDILEMMAS基准上显著优于ECoT、Plan-and-Solve和元认知提示等基线方法,为AI系统中自我情绪的出现提供了基础。

arXiv AI模型 / Agent / 研究站内正文
用于检测AI智能体科学理论转变的层论传输与障碍框架

该论文提出一种有限层论框架,通过传输和障碍检测AI智能体中的科学理论转变。框架将上下文组织为局部到全局结构,通过拟合、限制和粘合测试评估障碍,并在过渡卡基准上验证。主要结果是直接障碍排序,能够区分变形和扩展。

arXiv AIAgent / 研究 / 机器人站内正文
基于自回归序列模型的条件属性估计

本文提出条件属性变换器(CAT),一种在单次前向传播中同时估计下一词概率和基于每个候选词的条件属性值的方法,实现了逐词信用分配、反事实分析和可控生成,在稀疏奖励任务上达到最优性能。

arXiv AI模型 / 研究站内正文
PolitNuggets:智能体发现长尾政治事实的基准测试

该论文提出了PolitNuggets,一个多语言基准测试,用于评估大型推理模型在智能体框架中发现和综合长尾政治事实的能力。该基准通过构建400位全球精英的政治传记,涵盖超过10000个事实。研究者提出了FactNet协议,用于评分发现、细粒度准确性和效率。实验表明,当前系统在细粒度细节上表现不佳,且效率差异显著。诊断分析揭示了短上下文提取、多语言鲁棒性和可靠工具使用的重要性。

arXiv AIAgent / 研究站内正文
PREPING:无任务构建智能体记忆

智能体在进入新环境时面临冷启动问题,因为缺乏任务特定经验。本文提出PREPING框架,通过提议者引导的合成任务生成和选择性记忆更新,使智能体在无任务情况下构建程序性记忆。实验表明,该方法在多个基准上性能与基于剧本的方法相当,且部署成本显著降低。

arXiv AIAgent / 研究站内正文
AI智能体设计模式的二维框架:认知功能与执行拓扑

本文提出了一种结合认知功能(七类)和执行拓扑(六种结构原型)的二维分类法,用于系统描述LLM-based智能体架构。该7x6矩阵识别了27种命名模式,其中13种为原创命名,并在四个真实领域(金融贷款、法律尽职调查、网络运维、医疗分诊)验证了覆盖度。跨领域分析得出了五个模式选择的经验定律。

arXiv AI模型 / Agent / 政策站内正文
基于混合整数目标规划的用户自定义份量粒度的个性化膳食优化

提出混合整数目标规划(MIGP)用于个性化膳食优化,采用整数变量解决份量不切实际的问题,并通过目标规划偏差变量实现软营养约束,逆目标归一化平衡多营养目标。在810个实例中,MIGP在66%的情况下优于带后舍入的目标规划,且100%可行,求解时间低于100毫秒。开源Python模块已集成至交互式膳食规划应用。

arXiv AI研究 / 创业融资站内正文
GraphBit:一种基于图的非线性智能体编排框架

GraphBit是一种引擎编排的框架,通过有向无环图(DAG)定义工作流,解决了提示编排中的幻觉路由、无限循环和不可重复执行问题。它采用Rust引擎管理路由、状态转换和工具调用,支持并行分支、条件控制和错误恢复。三层记忆架构隔离上下文,防止长管线中的上下文膨胀。在GAIA基准测试中,GraphBit以67.6%的准确率、零框架诱导幻觉、11.9ms延迟和最高吞吐量超越六个现有框架。消融研究显示每个记忆层都有贡献,确定性执行在工具密集型任务中增益最大。

arXiv AI模型 / Agent / 研究站内正文
身体移动之前:学习面向语言条件人形控制的预期关节意图

本文提出DAJI(动力学对齐的关节意图)框架,一种分层架构,学习语言生成与闭环控制之间的预期关节意图接口。DAJI-Act通过学生驱动轨迹将未来感知教师蒸馏为可部署的扩散动作策略,而DAJI-Flow从语言和意图历史自回归生成未来意图块。实验表明,DAJI在预期潜在学习、单指令生成和流式指令跟随中表现优异,在HumanML3D风格生成上达到94.42%的轨迹成功率,在BABEL上达到0.152的子序列FID。

arXiv Robotics模型 / 政策 / 研究站内正文
节能四足机器人运动:采用柔性足部

四足机器人通常使用刚性足部以简化控制,但导致能量消耗较高。本研究将足部柔顺性集成到强化学习运动控制器中,通过仿真和实际机器人实验发现,选用适当刚度的柔性足部可将能量消耗降低约17%,同时保持运动稳定性。

arXiv Robotics研究 / 机器人站内正文
Distill:揭示人机通信背后的真实意图

一种名为Distill的新方法通过简化任务规范,帮助机器人更准确地理解人类意图。该研究通过众包实验验证了其有效性。

arXiv Robotics研究 / 机器人站内正文
基于反应式规划的移动机器人在复杂障碍环境中的控制方法

本文提出了一种基于反应式规划的移动机器人控制策略(RPCS),用于在仅具有部分环境信息的情况下实现从起始点到目标点的无碰撞运动。该策略结合了反应式规划(RPS)进行局部轨迹修改以避障,以及自适应跟踪控制(ATCS)通过离散化技术跟踪修改后的轨迹。数值示例验证了其有效性。

arXiv Robotics研究 / 机器人站内正文