AI News HubLIVE

AI 新闻实时情报

实时监测

今天 AI 世界最重要的变化

来自 105 个可信来源,最近更新 2026-05-20 12:00 UTC+8。

实时监测

实时更新

实时跟踪可信来源,保留出处、权限和站内阅读模式,把噪声压成可读情报。

实时更新

重置
通过全循环Transformer简单稳定循环

全循环Transformer通过两种无参数修改——全循环架构和注意力注入——解决了循环Transformer训练不稳定的问题,实现了最多12次循环迭代的稳定训练,并提升下游任务性能高达13.2%,同时允许在推理时灵活调整计算预算。

arXiv Machine Learning模型 / 研究站内正文
UCCI:校准不确定性实现成本最优的LLM级联路由

UCCI是一种校准优先的路由器,通过等渗回归将token级边际不确定性映射为每个查询的错误概率,并通过约束成本最小化选择升级阈值。在NER生产工作负载上,UCCI以micro-F1=0.91将推理成本降低31%,并将ECE从0.12降至0.03。

arXiv Machine Learning模型 / 芯片 / 研究站内正文
HELLoRA:混合专家模型的热门专家层层级低秩适配方法

HELLoRA是一种针对混合专家(MoE)模型的高效微调方法,仅对每层最活跃的专家附加LoRA模块,从而减少可训练参数和适配器带来的计算量,同时提升下游任务性能。在OlMoE、Mixtral和DeepSeekMoE等模型上,HELLoRA在数学推理、代码生成和安全对齐任务中均优于现有方法,例如在OlMoE上仅使用15.7%的参数,减少38.7%的FLOPs,吞吐量提升1.9倍,准确率提高9.2%。

arXiv Machine Learning模型 / 政策 / 研究站内正文
用于Transformer模型压缩的鲁棒基样条解耦方法

本文提出了一种基于B样条的解耦框架R-CMTF-BSD,通过约束耦合矩阵-张量分解与鲁棒交替最小二乘算法,实现Transformer模型参数的大幅压缩,同时保持精度。在Vision和Swin Transformer上的实验表明,该方法能显著减少参数并维持竞争性准确率。

arXiv Machine Learning模型 / 研究站内正文
维度平衡提升大规模时空预测性能

该研究通过空间和时间熵度量诊断时空复杂度不匹配,提出可扩展自适应框架,压缩空间维度并扩展时间范围,在交通、气象和疫情数据集上显著提升预测精度。

arXiv Machine Learning模型 / 研究站内正文
DecisionBench:长视界智能工作流中的新兴委托基准

DecisionBench 是一个用于评估长视界智能工作流中新兴委托能力的基准平台。它固定了任务套件(GAIA、tau-bench、BFCL multi-turn)、模型池(11个模型,来自7个供应商家族)、委托接口(call_model及可选的read_profile通道)、确定性技能标注层以及多维指标套件(覆盖质量、成本、延迟、委托率、路由保真度、供应商自我偏好及反事实委托上限)。该基准框架不依赖于代理信息的生成或传递方式,因此可评估学习型路由器、富代理记忆、自适应配置文件构建以及多步委托等方法。研究团队在完整模型池上进行了五次条件参考扫描,共涉及23,375个任务实例。主要发现包括:(i) 在四种感知条件下,平均终端任务质量在统计上无显著差异(|β| = 0.21),因此仅评估质量会忽略关键的编排信号;(ii) 在平均质量接近的情况下,路由保真度(top-1)在7.5%到29.5%之间变化,且传递渠道(按需工具 vs. 预加载描述)对结果的影响大于描述内容本身;(iii) 反事实上限表明,完美委托在每项任务套件上的性能比当前测量值高出15到31个百分点,揭示了未来编排方法巨大的未开发空间。研究团队已公开发布该基准平台、标注层、参考干预套件、分析流水线以及220个按条件运行的存档。

arXiv AIAgent / 研究站内正文
干扰感知的多任务遗忘学习

机器遗忘学习旨在从训练模型中移除指定数据的影响,同时保持其余数据上的性能。现有研究主要集中于单任务场景,而现代模型往往在共享主干的多任务设置中运行,移除一个任务或实例的监督可能会无意中影响其他任务。本文介绍了多任务遗忘学习的两种设置:全任务遗忘和部分任务遗忘,并提出了一种干扰感知框架,结合任务感知梯度投影和实例级梯度正交化,有效减少了任务间和实例间的干扰。实验表明,该方法在两种多任务计算机视觉基准测试中,相比最强基线,在全任务遗忘中降低了30.3%的UIS,在部分任务遗忘中降低了52.9%。

arXiv AI研究站内正文
可信代理网络:代理网络中的信任必须内建,而非外挂

一篇新的愿景论文认为,代理到代理(A2A)网络中的信任无法通过改造现有的个体代理对齐技术来实现。相反,信任必须从协调框架一开始就进行架构设计。该论文提出了一个包含四个设计支柱的概念框架,以应对系统性漏洞,如对抗性组成、语义不对齐和级联操作故障。

arXiv AI模型 / Agent / 研究站内正文
KAN-MLP-Mixer:Kolmogorov-Arnold网络用于改进基于IMU的人体活动识别的综合研究

本研究提出一种混合架构KAN-MLP-Mixer,结合Kolmogorov-Arnold网络(KAN)的精度与多层感知机(MLP)的噪声鲁棒性和效率,用于基于IMU的人体活动识别(HAR)。在8个公开数据集上,混合模型相比纯MLP模型平均宏F1分数提升5.33%,显著优于单独的KAN和MLP基线。该策略还能一致提升其他先进HAR架构的性能。

arXiv AI模型 / 研究站内正文
AgentNLQ: 一种面向自然语言到SQL的通用智能体

本研究提出一种多智能体方法AgentNLQ,在BIRD基准上实现了78.1%的语义准确率,通过语义增强的架构表示和业务规则生成准确SQL查询,其关键创新包括优化编排器、先进架构增强方法,并证明了其跨域泛化能力。

arXiv AI模型 / Agent / 研究站内正文
Learn-by-Wire训练控制治理:有界自主训练在压力下的稳定性和效率

本文提出Learn-by-Wire Guard(LBW-Guard),一种在AdamW之上运行的有界自主训练控制治理层,通过观察训练遥测、解释不稳定敏感区域并施加有界控制,在不替换优化器的情况下提升大型语言模型训练的稳定性和效率。在Qwen2.5系列模型上的实验表明,LBW-Guard可将7B模型的最终困惑度从13.21降至10.74(改善18.7%),同时端到端训练时间减少约10%。在强学习率压力下,AdamW完全退化,而LBW-Guard仍能保持可训练性,困惑度维持在11.57和10.33。

arXiv AI模型 / 政策 / 研究站内正文
评估个人健康记录在个性化健康AI中的效用

该研究评估了大型语言模型(Gemini 3.0 Flash)在提供个人健康记录(PHR)上下文时回答用户健康查询的能力。使用了2257个查询和1945份去标识化的PHR,比较了无上下文、基本摘要和完整临床笔记三种条件下的回答。结果表明,使用PHR数据后,所有类型查询的回答帮助性显著提高,并在安全性、准确性、相关性和个性化方面有所提升。同时,新开发的评估框架发现了LLM在理解复杂PHR时的不足,如时间混淆和罕见但重要的幻觉。

arXiv AI模型 / 政策 / 研究站内正文
文档AI生产化:面向OCR与LLM管线的微服务架构

本文提出一种微服务架构,将分类、光学字符识别(OCR)和大语言模型结构化字段提取管线封装在一起,并分享了每小时处理数千份多页文档的生产经验。关键设计包括混合分类、GPU与CPU分离、异步I/O处理及独立水平扩展。批处理分析揭示两个意外发现:OCR主导端到端延迟,系统并发由共享GPU推理容量而非工作进程数决定。

arXiv AI模型 / 芯片 / 研究站内正文
将隐性知识转化为运营绩效

制造业劳动力老龄化导致关键操作知识流失。本文探讨如何利用生成式AI将专家经验转化为结构化数字工作指令,从而减少缺陷、提高产量,并确保知识传承。

Emerj AI ResearchAgent / 芯片 / 政策站内正文
【AINews】Google I/O 2026:Gemini 3.5 Flash、Omni(NanoBanana 视频)、Spark(后台代理)和 Antigravity 2.0

Google I/O 2026 发布了 Gemini 3.5 Flash(具备 100 万 token 上下文、65k 最大输出、四种思考级别和跨轮思考保留,现已正式可用)、Gemini Omni(用于视频生成和编辑的多模态系列)、Antigravity 2.0(包括桌面应用、CLI、SDK 和托管代理),以及 Search 中的生成式 UI 和后台信息代理。谷歌声称每月处理 3.2 万亿 token,同比增长 7 倍,Gemini 月活用户达 9 亿。

Latent Space模型 / Agent / 芯片站内正文
生成式AI与艺术的不兼容性:与特德·姜的问答

特德·姜在普林斯顿大学的演讲中探讨生成式AI与艺术的不兼容性,认为AI被资本主义用于榨取价值,而人文教育的目标是培养超越工厂工人的毕业生。他质疑AI对创意写作的帮助,比喻用ChatGPT写论文如同在举重房开叉车,并建议学生将作业视为脑力训练。此外,他称赞电视剧《安多》是对抗法西斯主义的深刻描绘。

Hacker News AI研究站内正文
为何“快速AI”与“安全AI”从未冲突

AI治理并非减缓采用,而是实现规模化AI的关键。快速AI与安全AI的误判二分法通过认识到安全能通过信任加速部署而得以解决。

Hacker News AIAgent / 政策站内正文
企业AI:神秘代码、杀伤区、认知投降、氛围炸弹

企业AI项目的高失败率源于缺乏专门优化AI系统的企业级架构。员工使用消费级聊天机器人导致敏感信息泄露。所谓的“氛围编码”生成大量漏洞代码,造成未来不可预测的安全隐患。

Hacker News AI政策 / 研究站内正文
第二天在TechEx North America证明价值

TechEx North America第二天聚焦AI和大数据,讨论了AI实验难以转化为持久系统的“AI墓地”现象,强调从实验到实际影响的转变。会议涵盖企业AI实施、投资回报、代理式AI、治理和信任等主题。

Artificial Intelligence NewsAgent / 政策站内正文
GPU遥测异常:A100闲置功耗达146瓦(白皮书)

一份白皮书揭示,NVIDIA A100 GPU在报告利用率0%的情况下,功耗可达146.66瓦,暴露了GPU遥测中的关键盲点。作者提出新的能效基准(CEI)和开源优化器来检测此类“幽灵”异常。

Hacker News AIAgent / 芯片站内正文
苏姿丰上海开讲:AI正在重新定义计算的每一层

AMD AI开发者大会首次落地上海,CEO苏姿丰指出AI正在重新定义计算的每一个层次,竞争焦点从模型能力转向系统工程与全栈优化。中国在开放生态中领跑,AMD持续加码中国开发者生态建设,提供从云端到端侧的全栈算力方案,以ROCm开源平台为核心,帮助开发者应对Agent时代的新挑战。

量子位Agent / 芯片站内正文
StartupStarter – 我们构建了公司大脑,让AI为你工作

StartupStarter 是一个为创始人打造的AI原生操作系统,集成CRM、邮箱、智能体、文档、财务和融资于一体。其AI助手S2X能学习业务运作,自动化任务,如管理邮箱、草拟回复、处理交易、准备数据室等。平台还提供关系智能、自适应学习和持续信号处理功能。

Hacker News AIAgent / 政策站内正文
你的一切行为都在被记录

随着AI可穿戴记录设备的兴起,隐私保护面临新挑战。从黑手党的反监听措施到现代技术对抗,文章探讨了监控与反监控的军备竞赛,并指出科技巨头可能在这场博弈中占据上风。

Hacker News AI政策 / 研究站内正文
谷歌首款AI智能眼镜今秋发布,支持iPhone

谷歌宣布首款AI智能眼镜将于今秋发布,与三星、Gentle Monster和Warby Parker合作。眼镜运行Android XR,配备摄像头、扬声器和麦克风,但无显示镜片。集成Gemini AI,支持识别物体、导航、通话、消息、音乐、拍照、实时翻译等多种功能,并能与iPhone配合使用。苹果自家AI眼镜预计2027年才推出。

Hacker News AI工具站内正文
今日Hacker News的爬虫用户代理一览

本文展示了一份今日爬取Hacker News的用户代理列表,包括各类浏览器、搜索引擎爬虫、AI机器人以及自定义爬虫,反映了HN内容的广泛影响力。

Hacker News AIAgent / 研究站内正文
在Applied Compute扩展强化学习

Applied Compute 使用强化学习为企业(如 DoorDash、Cognition、Mercor)训练定制 AI 代理,并在 Modal 上运行。其核心理念是“特定智能”:通过专有数据训练,每次使用都能改进。本文介绍了他们的 RL 训练循环、基础设施选择以及 Modal 如何提供灵活性、性能和可靠性。

Modal BlogAgent / 芯片站内正文
OpenAI教育国家计划的新阶段

OpenAI推进教育国家计划,通过新的合作伙伴关系、教师培训和工具,扩大AI在学校中的应用,以改善全球学习成果。

OpenAI News工具站内正文