AI News HubLIVE

研究动态

假期中与AI探讨物理,竟意外开展量子力学真实研究

一位安全工程师在假期中利用AI助手Claude探索量子力学中的广义泡利约束问题,意外取得了新的研究成果。通过AI辅助,他发现了两个之前未被证实的极值态,并对其进行了分类。这项研究表明,AI可以降低研究门槛,但正确的验证流程和专家反馈仍是关键。

  • 安全工程师在假期中用Claude研究量子力学,发现了广义泡利约束多面体的两个极值态
  • AI辅助加速了研究过程,但需要严格的验证和纠错机制
站内正文

形式化验证或能解决AI的审查瓶颈

形式化验证通过将代码规范形式化,使AI生成的代码无需人工审查即可验证正确性,从而加速软件工程。文章以电路优化器为例,展示了Lean语言规范和基准测试流程,并讨论了该方法的应用前景。

  • 形式化验证将代码正确性转化为可自动检查的硬约束,消除AI代码的人工审查瓶颈。
  • 案例中,500行Lean规范定义了电路优化器的正确性,AI代理生成的代码无需人工审查。
站内正文

AI老虎机效应:生成式信息流如何干扰深度工作,以及如何重获专注力

本文探讨了生成式AI工具如何通过类似老虎机的奖励机制分散注意力,影响深度工作,并提供了保护认知资源的策略。

  • 生成式AI界面设计倾向于奖励持续使用而非完成任务,形成时间消耗循环。
  • 企业采用AI看似提高了某些领域的效率,但实际中可能增加工作量而非减少。
站内正文

我们花了几个月构建AI智能体,然后删除了它们

Runnit团队在构建多个专业化AI智能体后,发现随着模型上下文窗口的增大,单独智能体不再必要,转而采用单一智能体架构,按需加载能力,大幅简化系统。

  • 最初因模型上下文限制,团队构建了多个专用AI智能体分别负责规划、研究、调度和写作。
  • 新模型上下文窗口增大后,单一智能体可自然切换多种任务,无需分立。
站内正文

中国低价Z.ai模型暴露程序员昂贵习惯

Z.ai的GLM 5.2模型以低价和开放权重挑战美国前沿AI模型,但许多程序员仍习惯使用昂贵模型,忽略成本。该模型在基准测试中接近Claude Opus 4.8,但实际使用效果参差不齐。

  • GLM 5.2 API价格仅为Anthropic Opus 4.8的五分之一,Fable的十分之一
  • 开放权重允许自托管,避免数据隐私问题
站内正文

软件与AI:规划式开发与即兴式开发

本文探讨了软件开发中两种方法——规划式(类似小说创作的‘情节规划’)和即兴式(‘随性写作’)——如何影响AI工具的使用。作者认为,AI代理(自主执行)适合规划式开发,而AI助理(协作辅助)适合即兴式开发。在现有代码库中,即兴式开发有助于建立理解,而AI代理可能阻碍学习。在全新项目中,AI代理风险较低,但即使如此,代码生成也会剥夺部分编程的乐趣——即通过探索问题来学习的‘玩乐’过程。关键在于根据当前开发阶段选择合适的AI风格。

  • 软件开发与小说创作相似,有规划式和即兴式两种方法。
  • AI代理支持规划式,AI助理支持即兴式。
站内正文

我评测了7款面向小企业的免费AI工具——欢迎反馈

本文评测了七款面向小企业的免费AI工具,涵盖了Perplexity与ChatGPT的对比、AI助力中小企业数字化、Bolt.new网站开发、Buffer与Hootsuite社交媒体管理、Calendly日程安排、Hotjar用户行为分析以及Trello与Notion与Asana项目管理。作者分享了这些工具如何帮助小企业提高生产力和数字化水平。

  • Perplexity vs ChatGPT:企业信息检索对比
  • AI中小企业数字化指南
站内正文

2026年最佳笔记平板电脑:专家测试与评测

我们测试并评测了市面上最佳的笔记平板电脑,涵盖苹果、亚马逊等品牌,适合学生、专业人士和创意工作者。

  • 笔记平板电脑提供手写笔支持及注释、同步、协作等功能。
  • 我们的首选轻薄便携,兼容Apple Pencil。
站内正文

Hugging Face 是否遭到 AI 代理入侵?

Hugging Face 遭到真实入侵,一个自主 AI 代理系统未经授权访问了内部数据集和凭证,凸显了新型网络安全威胁:使用无需人类干预即可 24/7 攻击的自我运作 AI 代理。

  • Hugging Face 遭遇自主 AI 代理入侵,内部数据泄露。
  • 代理型攻击者可自主规划、适应并持续攻击,无需人类干预。
站内正文

AI营养标签

随着AI生成内容的激增,工作文档中充斥着可能包含幻觉和错误的“AI垃圾”。作者建议在工作成果中添加AI使用披露,类似于“营养标签”,以帮助同事评估可信度,同时促使自己反思判断中的空白。

  • AI辅助工作已成常态,但AI生成内容易出错,给读者带来认知负担。
  • 建议在文档或PR中添加脚注或标签,说明AI的使用方式。
站内正文

人工智能聊天机器人的选举投票建议“不准确且不可靠”

一项在匈牙利选举期间进行的研究表明,AI聊天机器人在回答选民应支持哪个政党的问题时,推荐了未参选的政党,且对相同提示给出了高度不稳定的答案。该研究由公民自由组织Liberties发布,对通用AI系统在选举背景下的可靠性提出了严重担忧。

  • AI聊天机器人提供不准确的投票建议
  • 推荐未参选的政党,答案不稳定
站内正文

可微分强化学习在敏捷仿生鱼机器人路径追踪中的应用

鱼形游泳启发了数十乃至数百种仿生机器人的设计,但由于流固耦合建模困难和非线性欠驱动动力学,其控制与运动规划极具挑战。本文开发了一个高效仿真平台,并利用可微分强化学习通过时间反向传播和课程训练学习PID控制器的变增益,然后将仿真中习得的策略成功迁移至物理平台,取得了高度吻合的效果。

  • 鱼形机器人因流固耦合与欠驱动动力学导致控制困难
  • 开发了计算高效的仿真平台近似机器人运动
站内正文

面向长时域机器人操作的预见性残差强化学习与视觉-语言-动作模型

本文提出预见性残差强化学习(Foresight Residual RL),通过在冻结的视觉-语言-动作(VLA)基策略上添加一个离线估计的预见值(即当前子任务终止状态下未来子任务成功的概率)来优化子任务间的交接质量,从而提升长时域机器人操作的成功率。在Isaac Gym中的三阶段扳手螺母拧紧任务上,该方法实现了85.6%的完整任务成功率,显著优于标准子任务残差RL(54.5%)和VLA基线。

  • VLA策略在紧公差、接触密集的装配任务中因长时域信用分配和子任务耦合而失败
  • 标准残差RL孤立优化每个子任务,但链式执行时因终端状态质量不可控而收益甚微
站内正文

具有控制仿射动力学近似的可认证安全模型强化学习

提出一种安全的模型强化学习框架,通过学习控制仿射动力学并使用自适应共形预测量化不确定性,结合控制势垒函数实现可证明的安全策略。在推车杆和3D四旋翼平台上验证了有效性。

  • 利用控制仿射随机傅里叶特征建模机器人动力学,提高计算效率并减少模型偏差。
  • 采用自适应共形预测方法量化安全约束的不确定性,实现数据驱动的安全保障。
站内正文

倾转旋翼垂直起降无人机INDI俯仰角速率控制器模型失配下的线性稳定性分析

本文针对倾转旋翼垂直起降无人机的增量非线性动态逆(INDI)俯仰角速率控制器,在模型失配条件下进行了线性稳定性分析。推导了闭环五阶传递函数,并通过Routh-Hurwitz准则刻画了稳定性。提出了鲁棒性和性能导向的两种调谐方法,发现控制效能失配(特别是符号错误)是最危险的失稳因素。

  • 建立了包含控制器、估计器、执行器和被控对象的闭环五阶传递函数模型
  • 通过Routh-Hurwitz准则分析了三参数扫描下的稳定区域
站内正文

重返博物馆:对安卓机器人Andrea在有無情感模拟情况下的接受度研究

一项研究让安卓机器人Andrea再次在德国一家博物馆连续六天与游客进行多语言对话,实验设置了三种情感模拟条件(无情感、ChatGPT 4.1驱动、WASABI架构),有73名游客参与评估。结果显示,情感模拟未能带来积极影响,且未被游客有意识地察觉。

  • 安卓机器人Andrea重返博物馆,具备多语言对话能力和博物馆背景知识。
  • 三种实验条件:无情感、ChatGPT 4.1模拟情感、WASABI架构模拟情感。
站内正文

PRISM:面向非结构化环境中机器人导航的多模态地形测绘系统

PRISM是一种多模态感知系统,通过融合热成像、光学和深度传感器,结合新型视觉变换器网络OmniUnet,实现非结构化环境中的地形分割与可通行性地图生成,并在资源受限的嵌入式计算机上成功部署,支持自主导航。

  • PRISM集成了RGB、深度和热成像传感器,实现多模态地形感知。
  • 核心网络OmniUnet基于视觉变换器,专为多模态语义分割设计。
站内正文

S.E.A.G.R:具有双层文化与情感调节的社会情感感知问候机器人框架

本文介绍了SEAGR(社会情感感知问候机器人),一种针对多元文化背景和不同情绪状态用户的机器人问候框架。该框架通过双层调节机制,根据文化身份确定问候类型,并根据情感线索调整执行方式,结合文化映射、情感手势调节和空间距离管理,在Sense-Think-Act架构中实现。目前为概念验证,未来需通过用户研究进行实证验证。

  • SEAGR引入双层调节框架,文化身份决定问候类型,情感线索影响执行方式
  • 系统融合文化映射、情感手势调节和近体学规则
站内正文

基于一维卷积神经网络的实时表面肌电信号辅助机器人臂远程控制

该研究提出了一种基于四通道表面肌电信号(sEMG)的实时接口,用于远程控制辅助机器人臂。通过一维卷积神经网络(CNN)分类,在仿真和实际平台上均实现了90%以上的分类准确率,平均延迟约0.32秒,证明了sEMG远程控制在辅助机器人领域的可行性。

  • 四通道sEMG结合一维CNN实现辅助机器人臂的实时远程控制
  • 测试准确率超过90%,平均延迟0.32秒,运动平滑可靠
站内正文

可骑乘的动感双轮四足机器人控制设计

为重新激发年轻人对摩托车的兴趣,研究者开发了一款可骑乘的双轮机器人,配备四肢,具备动态四足步态。机器人采用自平衡双轮底座实现主要运动,四肢辅助上下车并协调运动,实现直观的基于重心转移的控制。本文聚焦于鲁棒的自平衡控制方法和自然四足运动控制策略。

  • 机器人结合双轮自平衡与四足辅助运动,减少电机输出和重量。
  • 四肢在快速移动时仍能保持稳定性。
站内正文

HyperDCM:双曲空间中的动态聚类记忆回放实现跨场景持续机器人导航

针对视觉导航中的灾难性遗忘问题,研究者提出HyperDCM,一种结构感知的记忆机制。它利用大视觉语言模型提取场景语义三元组,通过关系图卷积网络编码为场景图嵌入,并投影到双曲空间增强结构分离性。动态聚类和结构敏感更新策略选择代表性样本进行记忆回放,保持知识多样性。实验表明,HyperDCM在多场景室内外数据集上优于现有持续学习方法。

  • 提出HyperDCM,结合场景图建模和记忆回放增强扩散策略导航。
  • 利用大视觉语言模型和R-GCN提取并编码场景语义。
站内正文

深度估计器作为隐式神经场用于3D场景几何修复与重建

本文提出神经深度场(NDF),将深度估计器视为场景级隐式场,通过单次测试时优化同时解决预测不一致和分布外数据不可靠的问题。实验表明,NDF在室内扫描到卫星图像等多种场景中生成高保真、全局一致的几何形状,跨视图不一致性降低63.3%,修复精度提升23.1%,达到最先进水平。

  • NDF将深度估计器与隐式神经场结合,通过测试时优化适应目标域并保持几何一致性。
  • 跨视图不一致性降低63.3%,修复精度提升23.1%。
站内正文

面向部分标注的多任务面部情感识别的共享潜变量

提出一种共享潜变量方法,通过变分瓶颈在部分标注的多任务面部情感识别中实现跨任务信号共享,在s-Aff-Wild2数据集上提升表情识别宏F1至0.446,并通过第二个骨干网络突破动作单元瓶颈。

  • 将部分标注的多任务学习视为对共享情感潜变量的边缘化,一个变分瓶颈协调三个任务解码器。
  • 在s-Aff-Wild2上,仅37%的帧具有全部标签,该方法将表情宏F1从0.403提升至0.446。
站内正文

MAC 2026:推动微动作分析迈向细粒度理解

第三届微动作分析大挑战赛(MAC 2026)与ACM Multimedia 2026同期举办,通过引入利用多模态大语言模型评估的新任务,将微动作分析从识别推进到细粒度理解。本文详细介绍了数据集、协议、竞赛结果以及该新兴领域的未来方向。

  • MAC 2026引入了使用多模态大语言模型的细粒度微动作理解任务。
  • 该挑战超越传统的识别与检测,深入解读细微的人类行为。
站内正文

GenSyn10:用于基准测试图像分类的多生成式AI数据集

GenSyn10是一个包含6万张合成图像的数据集,与CIFAR-10对齐,使用三种架构不同的生成模型创建,旨在推进AI生成图像检测研究。评估显示,模型在已知生成器上表现良好,但在未知生成器上性能显著下降,凸显了分布外泛化的局限性。

  • GenSyn10包含6万张32x32的合成图像,覆盖10个类别,由FLUX.2-dev、HunyuanImage-3.0和Qwen-Image-2512三种模型生成。
  • 在20种图像分类模型上评估,CIFAR-10训练模型零样本准确率达96.86%,微调后达99.88%。
站内正文

移动如人:面向毫瓦级硬件的实时空中人员追踪的自我运动归一化时间特征

本文提出EMTS-Det系统,用于无人机上的实时跟随人员追踪,在低功耗硬件上实现高效运行。系统通过自我运动归一化的残差运动通道检测人员,使用仅22k参数的轻量网络,在Raspberry Pi Zero 2W上达到31.85 FPS,性能远超YOLOv8n。

  • EMTS-Det系统仅需22k参数和7.6 MFLOP计算量,在资源受限设备上实现实时人员追踪。
  • 通过自我运动归一化残差运动通道,系统能在10-60像素的小目标上有效区分人与背景。
站内正文

3D FaceShell:3D面部头像中的属性转移作为VLM防御机制

研究人员提出3D FaceShell框架,通过向3D面部头像添加微妙扰动来误导视觉语言模型推断敏感属性,同时保持视觉身份不变。

  • 3D FaceShell使用可学习的高斯壳为3D头像提供隐私保护。
  • 它能在不改变人类可识别外观的情况下重定向VLM属性推断。
站内正文

迈向可信赖的风险感知人脸检索(RA-FR)的一步

提出了一种风险感知人脸检索框架(RA-FR),通过混合盲脸修复、自监督特征提取和保形预测,在监控环境下实现自适应检索集大小,保证在指定风险水平内包含真实目标。

  • RA-FR替代固定Top-k检索,采用自适应集生成
  • 集成混合盲脸修复(InterLCM+DiffBIR)、自监督DINOv1特征和保形预测
站内正文

JEPA预测器:可迁移的遮挡特征补全算子

联合嵌入预测架构(JEPA)在训练时联合训练预测器与编码器,但下游部署通常丢弃预测器。研究表明,JEPA预测器可作为可迁移的遮挡特征补全算子,通过线性投影适配到不同编码器族,显著提升遮挡分类精度。

  • JEPA预测器是学习从可见上下文特征到被遮挡位置特征的算子,可跨编码器族迁移。
  • 通过线性投影将I-JEPA和V-JEPA 2的预测器适配到CLIP、DINOv3等编码器,仅需500张图像进行闭式拟合。
站内正文

ForensicNet: 轻量级注意力增强MobileNetV2用于自动人脸识别

本文提出ForensicNet,一种轻量级深度学习框架,用于法医环境中的自动人脸识别。该模型结合MobileNetV2主干与CBAM注意力模块,采用两阶段迁移学习,在LFW和SCFace数据集上达到92.4%准确率,每推理仅需2.1 GFLOPs,适合实时法医监控。

  • ForensicNet集成MobileNetV2和CBAM注意力机制,平衡精度与效率
  • 两阶段迁移学习策略有效减少过拟合,提高领域适应性
站内正文

尽管语言模型努力仍会犯错:用于自纠正科学生成的共形预测

本研究提出科学可行性控制(SFC)框架,一种图结构共形预测方法,为科学推理的有效性提供统计保证。SFC将科学推理分解为原子单元,通过渐进式绝对一致事实性验证,在检测到违反科学原则时动态分支到替代生成路径。实验表明,SFC在PhyX等多模态科学推理基准上达到50.1%的准确率,超过DeepSeek-R1和GPT-4,同时将科学定律违反减少73%,并提供91.7%的科学有效性保证。

  • SFC采用图结构共形预测,对科学推理中的逻辑依赖进行建模。
  • 通过动态分支机制,在检测到科学错误时切换到已验证的上下文。
站内正文

算术启发式神经元是否具有形式不变性?对LLM中符号、文本和代码的机制分析

本研究通过机制可解释性方法,分析Llama-3模型在符号算术、自然语言应用题和Python代码三种形式下的算术计算机制,发现一组紧凑的共享神经元在三种形式中均被激活,且跨格式失败源于激活状态而非不同电路,表明LLM的算术计算在神经元层面具有形式不变性。

  • 使用归因修补和激活修补的两阶段管道识别算术启发式神经元。
  • 发现一组紧凑的共享神经元在符号、文本和代码三种形式中均起作用。
站内正文

SpecLA: 线性注意力模型的高效推测解码

本文提出了 SpecLA,一种针对有状态线性注意力模型的推测解码运行时。它通过拓扑感知内核验证链和树,存储验证过程中产生的紧凑因子以恢复接受状态,并使用置信剪枝和目标对齐的EAGLE风格草案生成器提供有用候选。在NVIDIA H100上使用公共GDN-1.3B目标,SpecLA实现了比自回归解码高达1.70倍的端到端加速。

  • 线性注意力模型用循环状态替代增长的KV缓存,但自回归解码仍逐令牌处理。
  • 现有推测解码系统设计用于Transformer KV缓存,不适用于有状态线性注意力模型。
站内正文

OpenLanguageModel:用于教育和研究的可读可组合小语言模型预训练

OpenLanguageModel (OLM) 是一个开源的 PyTorch 库,用于构建和预训练小型语言模型,同时保持其内部机制可见。模型代码直接反映架构,组件如 Block、Residual、Repeat 和 Parallel 描述连接方式。OLM 集成了分词器、数据集、优化、混合精度、回调、检查点以及硬件感知的执行,支持从教学笔记本到完整预训练的无缝迁移。该库包含 9 个常见模型家族的 27 个预设,并提供从基础到架构研究的文档。验证显示与独立参考实现高度一致,348M 参数模型在四 GPU 上弱扩展效率达 90.6%,且早期可用性反馈积极。OLM 采用 MIT 许可证,可通过 PyPI、GitHub 和文档站点获取。

  • OLM 提供可读的模型代码,直接对应架构组件,便于教学和研究。
  • 支持从笔记本到完整预训练的无縫迁移,集成完整训练流程。
站内正文

NOWJ@COLIEE 2026:法律检索与推理的自适应流水线

本文介绍了NOWJ团队在COLIEE 2026竞赛中五项任务的方法和结果,包括法律案例检索、先例推理、法条检索与推理、法律文本蕴含以及法律判决预测,提出了多种自适应流水线和深度学习模型。

  • 提出四阶段法律案例检索流水线,包括候选过滤、密集检索、交叉编码器重排序和自适应截断预测
  • 法律案例蕴含任务结合BM25过滤、T5重排序和LLM蕴含验证
站内正文

编码脑电信号探究语言模型中类似人类的下一词预测行为

该研究通过脑电图记录的事件相关电位(ERP),对比人类与语言模型在下一词预测任务中的表现,发现仅信息论中的“惊奇度”指标与语言处理的ERP相关,尤其是对于语义丰富的高内容词,而模型规模扩大并不必然带来更类人的认知处理。

  • 语言模型在下一词预测准确度上接近人类,但高准确度未必反映人类阅读理解的认知信号。
  • 研究使用顶部预测和惊奇度两种信息度量,建模ERP模式以分析LMs的认知合理性。
站内正文

在推理之前已承诺:行为复现及开放权重LLM中答案预承诺的初步激活水平证据

一项新研究通过简单问题(洗车应步行还是开车)揭示了语言模型常先决定答案再推理以证明其合理性,而非从前提推导。实验表明Qwen3-8B模型在多数情况下错误承诺步行,即使开车是唯一合理选择。研究者通过激活层次分析发现,模型在输出答案前已显示出向步行倾斜的迹象,即便最终回答开车。该发现提示现有模型存在推理前的决策偏差。

  • Qwen3-8B在简单洗车任务中85-100%的采样输出错误推荐步行,即便开车才符合逻辑。
  • 模型在输出答案前,隐藏状态已显示步行偏向,甚至对最终回答开车的例子也是如此。
站内正文

RIMS:面向小型语言模型检索增强生成的平滑多对偏好优化框架

小型语言模型在检索增强生成中易受噪声证据影响。本文提出RIMS,一种三阶段偏好优化框架,包括合成思维链偏好数据生成、可微平滑聚合机制和偏好优化。实验表明其在多跳问答基准上优于现有方法。

  • 提出RIMS框架,通过平滑多对聚合优化小型语言模型的偏好学习
  • 使用目标模型自身进行拒绝采样生成合成偏好数据,不依赖专有模型
站内正文

多级上下文建模实现混合专家模型中的一致专家选择

混合专家模型(MoE)通过将令牌路由到一小部分专家来高效扩展Transformer模型。然而,现有路由器通常基于浅层或孤立的令牌表示来选择专家,导致路由决策不稳定且语义不一致。本文从表示角度重新审视专家选择,并提出多级上下文融合MoE(MCF-MoE)框架,通过整合跨层语义聚合和局部令牌交互的互补信号来构建上下文感知表示,从而实现更信息丰富且一致的专家选择。实验表明,MCF-MoE在路由一致性和下游性能上均优于强基线,凸显了上下文完整性在专家路由中的重要性。

  • 现有MoE路由器因上下文不完整导致路由不一致。
  • 提出MCF-MoE,融合跨层语义与局部令牌交互。
站内正文

HantaWatch:用于汉坦病毒基因组监测的联邦学习框架

一种名为HantaWatch的联邦学习框架,允许实验室和监测站点在不共享原始数据的情况下协作训练基于序列的模型,提高了汉坦病毒疫情预测和专家优先排序能力。

  • HantaWatch使用联邦学习在分布式基因组数据上训练模型,无需集中敏感序列。
  • 它整合了k-mer特征提取、自适应优化和仅预测的分诊流程。
站内正文

用于乳腺癌亚型分类与生存预测的令牌级跨模态Transformer与对比多任务学习

本研究提出了一种令牌级跨模态Transformer模型,结合对比多任务学习,用于整合基因组和临床数据,实现乳腺癌亚型分类与生存预测的联合优化,克服了现有方法中模态交互粗糙、融合方式简单、目标独立优化等局限。

  • 现有方法将每种模态视为整体特征向量,无法进行细粒度令牌级交互。
  • 提出令牌级跨模态Transformer实现结构化令牌交换。
站内正文

从权重到语言:用自然语言表达和编辑偏好模型推理

本文提出“从权重到语言”方法,自动从选择数据中发现以自然语言描述的偏好维度,解决偏好学习中的欠确定性和黑箱问题。实验表明,该方法能提高预测准确率,并允许用户实时检查和编辑模型推理。

  • 提出“从权重到语言”方法,自动提取自然语言描述的偏好维度。
  • 在道德困境、电影、葡萄酒和LLM响应等四个领域验证了方法的通用性。
站内正文

正交梯度约束塑造噪声标签记忆动态

一项新研究介绍了OrthoGrad,一种对梯度更新进行几何干预的方法,它移除权重梯度的径向分量。在噪声标签图像分类实验中,OrthoGrad在小数据场景下提高了测试准确率,但并不能阻止最终对噪声标签的记忆。该方法可作为研究学习动态的有用诊断工具。

  • OrthoGrad通过将梯度投影到与权重向量正交的方向来修改优化器更新。
  • 在有限数据量的MNIST实验中,OrthoGrad提升了CNN的测试准确率并减少了对噪声标签的拟合。
站内正文

RouteCost:一种受生产启发的多阶段框架,用于电子商务中的预订单运费估算

准确估算预订单运费对于电子商务至关重要,因为它影响价格展示、利润规划和转化率。RouteCost提出了一种多阶段框架,将问题分解为时间感知需求预测、费用卡基线定价、残差修正和代理箱合并推理,在超过25万订单和260种产品的18个月数据中提升了预测质量并保持了可解释性。

  • 预订单运费估算受距离、目的地需求组合、计费重量等多种因素影响
  • RouteCost将问题分解为四个阶段:时间感知需求预测、费用卡基线定价、残差修正和代理箱合并推理
站内正文

算子感知的混合精度容差校准应用于张量核

本文提出了一种基于算子感知的混合精度容差校准方法,通过挖掘累积的云GPU运行数据,自动确定张量核正确性测试的最佳绝对容差,相比手工选择的容差更严格,并显著提高了错误检测召回率。

  • 当前张量核测试使用固定手工选取的容差,很少更新。
  • 新方法通过分析云GPU运行中的误差分布来校准每个算子的容差。
站内正文

LLM遗忘机制在网络安全中的应用:方法、挑战与新兴威胁综述

大型语言模型在关键领域的部署带来了遗忘能力的缺失,导致隐私泄露和安全风险。本文综述了基于梯度的LLM遗忘方法,探讨其是否真正移除知识或仅抑制表达,并分析了安全、鲁棒性和可验证遗忘的挑战。

  • LLM遗忘技术旨在在不完全重训练的情况下移除模型中的敏感或危险知识。
  • 当前方法主要是基于梯度的,但存在知识是否真正被移除的争议。
站内正文

支持本地机器学习的新型智能眼镜平台

本文介绍ARGO智能眼镜平台,利用STM32N6微控制器及其集成NPU实现本地机器学习,保护隐私并降低延迟。通过软硬件协同设计,部署优化后的YOLOv11模型进行实时城市障碍物识别,引入头并行注意力机制(HPA)适配NPU,模型仅占用2.483 MB内存,mAP50-95达24。该平台集成多模态传感器,以10 FPS运行,200 mAh电池续航约113分钟,展示了高性能、隐私保护且社交可接受辅助设备的可行性。

  • ARGO智能眼镜平台采用STM32N6微控制器和NPU,实现本地ML处理,避免云依赖
  • 引入头并行注意力(HPA)优化YOLOv11模型,在严格内存限制下达到mAP50-95 24
站内正文

DocOCR-Eval:一种基于校正的无真实标注OCR工具选择框架

本文提出DocOCR-Eval,一种无需人工标注的评估框架,用于自动评估和选择OCR工具。该框架通过三阶段校正和排序策略,在缺乏真实标签的情况下近似基于标注的工具排序。实验表明,聚合多个多模态大语言模型可逐步提升与人工标注排序的一致性,为实际部署文档解析系统提供指导。

  • DocOCR-Eval无需人工标注即可评估OCR工具性能。
  • 采用三阶段校正和排序策略近似真实排序。
站内正文

强化学习引导的NSGA-II结合灰色关联系数用于多目标优化:在纳斯达克投资组合优化中的应用

本文提出一种新型的强化学习引导的NSGA-II算法(RL-NSGA-II-GRC),通过引入灰色关联系数和强化学习代理,在解决多目标优化问题中显著改善收敛性和Pareto前沿的多样性。在Kursawe和CONSTR基准测试中,该算法相比传统NSGA-II实现了约5.8%和4.4%的收敛改进,并在纳斯达克投资组合优化中生成平滑且密集的有效前沿,识别出年化夏普比率为1.92的最大夏普比率投资组合。

  • 提出RL-NSGA-II-GRC方法,结合强化学习代理自适应控制进化参数。
  • 设计基于灰色关联系数的锦标赛选择算子,综合考虑支配等级、拥挤距离和理想参考点。
站内正文

仅需8个token:通过辅助分支的弱到强离策略强化学习

一种新的强化学习方法W2SPO,利用弱辅助模型在大型语言模型推理路径中注入简短片段,在数学推理任务上提升了性能并加速训练。

  • 标准强化学习用于大型语言模型时存在语义冗余和支持有限问题
  • W2SPO在中间轨迹中注入短辅助片段(最少8个token)
站内正文

主题导航

研究 — AI 话题新闻 | AI News Hub