AI News HubLIVE

AI 新闻实时情报

实时监测

今天 AI 世界最重要的变化

来自 105 个可信来源,最近更新 2026-05-19 12:00 UTC+8。

实时监测

实时更新

实时跟踪可信来源,保留出处、权限和站内阅读模式,把噪声压成可读情报。

实时更新

重置
多模态语言模型需要多少视觉标记?使用F^3A扩展视觉标记剪枝

随着多模态模型规模的增长,向语言骨干网络提供的视觉标记序列越来越长,导致推理成本上升。本文提出了一个基本问题:实际需要多少视觉标记,以及在固定预算下如何分配?现有免训练剪枝方法使用一次性代理,但作者认为视觉标记剪枝应视为任务条件证据搜索。他们提出了F^3A,一种在语言模型消费图像标记之前运行的免训练路由器,通过轻量级问题条件线索、冻结稀疏感知头匹配以及粗证据定位、局部细化、覆盖保持竞争和未覆盖区域恢复来分配固定预算。F^3A无需模型训练或额外LLM前向传播,保留了原有的多模态提示和推断流程。

arXiv Computer Vision模型 / Agent / 研究站内正文
StrLoRA:面向多模态大语言模型的流式连续视觉指令微调

本研究提出StrLoRA,一种正则化两阶段专家路由框架,用于解决流式连续视觉指令微调(StrCVIT)中模型需同时学习新能力、巩固已有能力并缓解遗忘的问题。StrLoRA通过任务感知专家选择和令牌级加权,显著优于现有方法。

arXiv Computer Vision模型 / 研究站内正文
Noise2Params:通过噪声统一并确定事件相机概率模型参数

本文提出了一种基于光子统计的事件相机概率模型,统一了静态场景噪声事件和阶跃响应曲线的描述。通过推导精确泊松、鞍点和高斯三种分布,揭示了这些行为的内在联系。基于该模型,提出了Noise2Params方法,仅需静态均匀场景即可确定相机参数(对比度阈值、转换因子和泄漏项)。实验表明,使用合成噪声数据训练的CNN在静态场景重建中优于仅用实验数据训练的模型。

arXiv Computer Vision研究站内正文
探索用于法院判决生成的轻量级大型语言模型

一篇系统研究轻量级(小于2B参数)大型语言模型在刑事法院判决生成任务中能力及其对罪名预测影响的论文。研究探讨了模型架构、规模与深度神经网络的对比,并开发了CVGEvalKit评估框架。实验揭示了模型大小与任务间权衡的新见解。

arXiv Computational Linguistics模型 / 研究 / 创业融资站内正文
基于检索的多标签法律注释:可扩展、数据高效且无幻觉

该研究提出了将多标签法律注释转化为检索任务的方法,使用冻结的检索模型嵌入文档和标签描述,并通过k近邻预测标签。在三个法律数据集上,该方法在准确性和数据效率上表现出色,并完全消除了生成模型产生的幻觉问题。

arXiv Computational Linguistics模型 / 研究站内正文
CHI-Bench:评估AI代理在端到端、长期、政策密集型医疗工作流程中的表现

新基准CHI-Bench旨在评估AI代理在真实医疗工作流程中的端到端自动化能力,重点关注政策密度、多角色组合和多边交互。测试结果显示,最佳代理仅能完成28.0%的任务,严格通过率低于20%,单会话执行时成功率降至3.8%。研究团队认为,类似差距可能在其他政策密集、角色复杂的领域中出现。

arXiv Computational LinguisticsAgent / 政策站内正文
一种用于发展语言研究中方式动词和结果动词测量的可扩展工具

该研究提出了一种基于大语言模型和RoBERTa分类器的计算工具,用于在句子上下文中自动识别方式动词和结果动词,平均准确率达89.6%。该工具通过语言学提示生成标注数据,覆盖436个动词类别,为发展语言研究中的动词语义分析提供了可扩展的测量方法。

arXiv Computational Linguistics模型 / 研究 / 创业融资站内正文
超越情感分类:一种用于文本情感强度评估的生成框架

本研究提出了一种新的情感建模方法,将焦点从识别转向评估,通过构建情感强度分数数据集并微调开放权重生成语言模型输出0-100的连续值,展示了比分类基线更富有表现力和通用性的框架,特别适用于金融等领域。

arXiv Computational Linguistics模型 / 研究 / 创业融资站内正文
arXiv扩展无障碍数学:HTML转换与MathML 4

arXiv自2023年起为TeX/LaTeX提交提供HTML版本,2025-2026年取得重要进展:社区驱动的改进解决了约一半的6000份用户报告;大规模转换工作旨在达到90%无错误HTML,目前为75%;初步集成MathML 4意图注释以支持语音输出;正在进行LaTeXML的Rust移植,以降低计算成本并加快预览速度。项目仍处于实验阶段,但正逐步成熟。

arXiv Computational Linguistics研究站内正文
PQR:一种生成多样化、逼真用户查询以触发问答代理失败的框架

PQR框架通过迭代交互两个互补模块(查询优化模块和提示优化模块),自动生成既能触发代理失败又符合真实用户意图的多样化查询。在电商问答代理评估中,该方法检测到的无帮助响应增加了23%-78%,且生成的查询比之前的方法更多样化和逼真。

arXiv Computational Linguistics模型 / Agent / 政策站内正文
LLM智能体系统中技能的规模定律

一项研究揭示了LLM智能体系统中技能库规模的缩放定律:路由误差随库大小对数增长,而正确执行可改善下游决策。通过优化,路由准确率从71.3%提升至91.7%,任务通过率显著提升。

arXiv Computational Linguistics模型 / Agent / 政策站内正文
AdaGraph:一种克服维度诅咒并实现科学发现的图原生聚类算法

AdaGraph是一种基于图原生的聚类算法,源自结构中心机器学习(SC-ML)范式。它通过k近邻图拓扑结构替代欧几里得距离度量,从根本上解决了高维数据中的维度诅咒问题。该算法无需预先指定聚类数量k,能原生处理噪声,并通过SLCD框架实现扩展。在10个合成基准测试(维度从10到5000)中,其配套的Graph-SCOPE指标平均ARI达0.900,在9/10数据集上正确选择k,优于传统指标。在肝细胞癌基因共表达、文本聚类和材料科学三个科学领域均取得了显著成果。

arXiv Machine Learning研究站内正文
中期阿尔茨海默病进展预测:基于残差间隙感知Transformer的24个月CDR-SB变化预测

本研究提出一种残差间隙感知Transformer模型,结合混合效应统计参考和Transformer残差学习,利用ADNI临床和生物标志物历史数据预测24个月CDR-SB变化。该模型通过锚点分析、不规则历史的三元组标记化和自注意力中的学习非负时间间隙惩罚,在多个指标上优于传统基线模型,MSE降低13.1%,相关性提高26.4%。

arXiv Machine Learning模型 / 研究站内正文
探究强化学习中循环神经网络的动作编码方式

该论文系统研究了在强化学习中使用循环神经网络(RNN)时,如何将动作信息纳入状态更新函数。作者讨论了多种动作编码选择,并在多个领域进行了实证评估,同时探讨了未来工作方向及强化学习特有的挑战。

arXiv Machine LearningAgent / 研究 / 创业融资站内正文
决策能力中的结构性阈值导致自对弈强化学习崩溃

研究发现,自对弈强化学习代理在不对称规则扰动下,当所有正到达决策点被消除时会迅速崩溃至最大损失固定点,而保留单个正到达决策点即可防止崩溃。该现象由约束下的共同适应机制驱动,与扰动本身无关,且具有时间不变性、可逆性,并在函数近似下加剧。

arXiv Machine LearningAgent / 研究站内正文
当动作消失:自对弈强化学习中的对抗性动作移除

研究自对弈强化学习中,攻击者通过选择性移除合法动作来破坏智能体决策。在扑克及非扑克领域的实验表明,学习型掩码比随机掩码和扰动基线造成更大伤害,且攻击可跨算法迁移、在自对弈中放大,且无法通过延长掩码训练恢复。

arXiv Machine LearningAgent / 研究站内正文
SignMuon:通信高效的分布式Muon优化

SignMuon是一种结合了signSGD的多数表决符号聚合与Muon极坐标步骤的1位、矩阵感知优化器。每个工作节点通过牛顿-舒尔茨迭代计算动量极因子,传输元素级符号并由多数表决聚合。在频谱范数平滑和有界方差随机梯度下,实现了O(1/√T)的非凸收敛率。在330个CIFAR-10/ResNet-50配置上,SignMuon取得了最佳验证准确率92.15%;其4-GPU多数表决变体在匹配有效批次下训练时间减少37%。在nanoGPT上,SignMuon实现了更低的困惑度和更好的即时性能。

arXiv Machine Learning芯片 / 研究站内正文
通过反事实推理路径减少信用分配方差

该论文提出了一种基于反事实对比的信用分配框架,用于大语言模型多步推理的强化学习。通过采样多条推理轨迹并利用其差异隐式近似替代决策,构建了过程级优势估计器,将稀疏的终端奖励转化为步骤敏感的学习信号。基于此提出的隐式行为策略优化(IBPO)显著提升了数学和代码推理基准上的训练稳定性和性能上限。

arXiv Machine Learning模型 / 政策 / 研究站内正文
带功能约束的变分不等式问题的镜像下降类算法

本文针对带功能约束(不等式型约束)的变分不等式问题,提出了多种镜像下降类算法。这些算法根据迭代中功能约束的值在生产性步骤和非生产性步骤之间切换,并采用不同的步长规则和停止准则。作者分析了这些算法,证明了对于有界单调算子和Lipschitz凸功能约束的问题,它们能够以最优收敛速度达到所需精度。此外,还提出了一种改进算法,通过在生产性步骤中考虑每个功能约束以及第一个违反可行性的约束,从而在多个约束下节省运行时间。对于δ-单调算子,该算法可应用于无法获得目标函数次梯度准确信息的约束最小化问题。数值实验验证了算法的性能。

arXiv Machine Learning模型 / 研究站内正文
Apple M3 Ultra上实时扩散模型推理的系统优化

本研究针对Apple M3 Ultra(60核GPU,512 GB统一内存)进行了10阶段的全面优化实验,旨在实现实时相机img2img变换。通过结合蒸馏专用模型SDXS-512的CoreML转换和3线程相机流水线,最终在512x512分辨率下达到了22.7 FPS。研究揭示了CUDA平台上的优化策略在Apple Silicon统一内存架构上并不有效,例如量化无法加速、并行推理无效以及神经引擎不适用于大规模模型,并提供了针对Apple Silicon的扩散模型推理实用指南。

arXiv Machine Learning模型 / 芯片 / 研究站内正文
LinAlg-Bench:揭示大语言模型数学推理中结构性故障模式的取证基准

LinAlg-Bench是一个诊断基准,通过3x3、4x4和5x5矩阵的严格维度梯度,评估了10个前沿大语言模型在结构化线性代数计算上的表现。该基准覆盖9种任务类型和660个SymPy验证的问题,全面评估了6600个模型输出。除了二元准确性,LinAlg-Bench还引入了一个三阶段自动取证流程,将1156个失败分类为十种主要错误标签及细分子类型,揭示了LLM的数学失败并非随机,而是受算法类型和矩阵维度的结构性约束。核心发现是模型在4x4规模处出现一个尖锐的行为阈值:低于此阈值时,模型因执行错误(如符号跟踪失败、算术漂移和奇偶错误)而失败;高于此阈值时,失败转变为计算放弃,模型通过工具角色扮演、约束一致的虚构和结构化幻觉来编造响应,而非尝试计算。这种从编造到放弃的转变在几乎所有模型层级和架构中普遍存在,暗示这是一个工作记忆限制而非知识差距,三种规模涌现的错误类型(在3x3中不存在但在4x4和5x5中出现)支持了这一观点。研究还表明,解策略僵化是5x5行列式准确性的近乎完美预测因子,记录了一种名为约束感知虚构的新型结构化幻觉故障模式,并公开了所有数据、模型输出、错误标签和判断流程。

arXiv AI模型 / 研究 / 创业融资站内正文
TTE-Flash:通过思考-然后-嵌入令牌加速基于推理的多模态表示

最新研究表明,通用多模态嵌入(UME)从链式思维(CoT)推理中获益显著,但生成显式CoT轨迹的计算开销过大。本文提出用潜在思维令牌替代显式CoT,这些令牌作为潜在变量可生成显式CoT轨迹作为观测变量。通过CoT生成损失优化思维令牌,再通过对比损失优化嵌入令牌,实现了恒定推理成本下的高性能、推理感知表示。研究探讨了两种关键架构设计,并推出了TTE-Flash-2B模型,在MMEB-v2基准上超越显式CoT对应模型,同时思维令牌可文本和视觉解释。此外,在15个视频数据集上的零样本评估显示,随着思维令牌数量增加呈现扩展行为,并启发了基于任务需求的自适应思维预算分配试点研究。

arXiv AI模型 / 研究 / 创业融资站内正文
PRISMat:策略驱动、置换不变的自动回归材料生成模型

PRISMat是一种高效的置换不变模型,用于晶体材料生成。与大型语言模型(LLM)相比,PRISMat在推理时间更短的情况下,在预测材料表面性质(如解理能和工作函数)方面表现更优,误差降低4倍。该模型采用策略驱动的方法,解决了传统LLM在材料科学中参数庞大、计算成本高的问题。

arXiv AI模型 / 政策 / 研究站内正文
对手建模并非策略:大语言模型谈判者的局限

一项新研究发现,虽然大语言模型代理在多属性谈判中能准确建模对手偏好,但未能将此信息转化为战略优势,导致最终协议主要由初始锚定值而非效用权重决定。

arXiv AI模型 / Agent / 研究站内正文
从提示到协议:用于实验室自动化的人工智能代理

研究人员开发了一种AI代理架构,将大型语言模型与实验室编排相结合,使科学家能够通过自然语言交互式创建和监控自动化实验室协议。该代理集成到实验编排系统(EOS)中,支持从协议创建到结果分析的完整实验生命周期,并在三个模拟自动化实验室中实现了97%的首选协议生成成功率和界面操作数量级的减少。

arXiv AI模型 / Agent / 研究站内正文
ANNEAL:通过受控符号补丁学习适应LLM代理

ANNEAL是一种神经符号代理,通过故障驱动知识获取(FDKA)机制,在不修改基础模型权重的情况下,将重复故障转化为过程知识图谱的受控符号编辑。在四个领域的测试中,ANNEAL将重复故障率降至0%,而基线方法如ReAct和Reflexion的故障率仍高达72-100%。

arXiv AI模型 / Agent / 政策站内正文
AgentWall:本地AI代理的运行时安全层

AgentWall是一个针对本地AI代理的运行时安全与可观测层,能够拦截代理操作、执行策略检查、要求人工审批并记录审计轨迹,在14项基准测试中实现92.9%的策略准确率和亚毫秒级开销。

arXiv AIAgent / 政策站内正文
Odyssey推出Agora-1:可实时交互的多智能体世界模型

Odyssey实验室发布Agora-1研究预览版,这是一个多智能体世界模型,允许多达四名人类或AI代理在实时生成的模拟中共享和交互,类似于黄金眼风格的体验。该模型可保持不同视角下的一致性状态,开创了视频模型、游戏模型与世界模型融合的新类别。

Product Hunt AIAgent / 研究站内正文