全循环Transformer通过两种无参数修改——全循环架构和注意力注入——解决了循环Transformer训练不稳定的问题,实现了最多12次循环迭代的稳定训练,并提升下游任务性能高达13.2%,同时允许在推理时灵活调整计算预算。
AI 新闻实时情报
实时监测
实时更新
实时跟踪可信来源,保留出处、权限和站内阅读模式,把噪声压成可读情报。
实时更新
UCCI是一种校准优先的路由器,通过等渗回归将token级边际不确定性映射为每个查询的错误概率,并通过约束成本最小化选择升级阈值。在NER生产工作负载上,UCCI以micro-F1=0.91将推理成本降低31%,并将ECE从0.12降至0.03。
HELLoRA是一种针对混合专家(MoE)模型的高效微调方法,仅对每层最活跃的专家附加LoRA模块,从而减少可训练参数和适配器带来的计算量,同时提升下游任务性能。在OlMoE、Mixtral和DeepSeekMoE等模型上,HELLoRA在数学推理、代码生成和安全对齐任务中均优于现有方法,例如在OlMoE上仅使用15.7%的参数,减少38.7%的FLOPs,吞吐量提升1.9倍,准确率提高9.2%。
本文提出了一种基于B样条的解耦框架R-CMTF-BSD,通过约束耦合矩阵-张量分解与鲁棒交替最小二乘算法,实现Transformer模型参数的大幅压缩,同时保持精度。在Vision和Swin Transformer上的实验表明,该方法能显著减少参数并维持竞争性准确率。
该研究通过空间和时间熵度量诊断时空复杂度不匹配,提出可扩展自适应框架,压缩空间维度并扩展时间范围,在交通、气象和疫情数据集上显著提升预测精度。
DecisionBench 是一个用于评估长视界智能工作流中新兴委托能力的基准平台。它固定了任务套件(GAIA、tau-bench、BFCL multi-turn)、模型池(11个模型,来自7个供应商家族)、委托接口(call_model及可选的read_profile通道)、确定性技能标注层以及多维指标套件(覆盖质量、成本、延迟、委托率、路由保真度、供应商自我偏好及反事实委托上限)。该基准框架不依赖于代理信息的生成或传递方式,因此可评估学习型路由器、富代理记忆、自适应配置文件构建以及多步委托等方法。研究团队在完整模型池上进行了五次条件参考扫描,共涉及23,375个任务实例。主要发现包括:(i) 在四种感知条件下,平均终端任务质量在统计上无显著差异(|β| = 0.21),因此仅评估质量会忽略关键的编排信号;(ii) 在平均质量接近的情况下,路由保真度(top-1)在7.5%到29.5%之间变化,且传递渠道(按需工具 vs. 预加载描述)对结果的影响大于描述内容本身;(iii) 反事实上限表明,完美委托在每项任务套件上的性能比当前测量值高出15到31个百分点,揭示了未来编排方法巨大的未开发空间。研究团队已公开发布该基准平台、标注层、参考干预套件、分析流水线以及220个按条件运行的存档。
机器遗忘学习旨在从训练模型中移除指定数据的影响,同时保持其余数据上的性能。现有研究主要集中于单任务场景,而现代模型往往在共享主干的多任务设置中运行,移除一个任务或实例的监督可能会无意中影响其他任务。本文介绍了多任务遗忘学习的两种设置:全任务遗忘和部分任务遗忘,并提出了一种干扰感知框架,结合任务感知梯度投影和实例级梯度正交化,有效减少了任务间和实例间的干扰。实验表明,该方法在两种多任务计算机视觉基准测试中,相比最强基线,在全任务遗忘中降低了30.3%的UIS,在部分任务遗忘中降低了52.9%。
一篇新的愿景论文认为,代理到代理(A2A)网络中的信任无法通过改造现有的个体代理对齐技术来实现。相反,信任必须从协调框架一开始就进行架构设计。该论文提出了一个包含四个设计支柱的概念框架,以应对系统性漏洞,如对抗性组成、语义不对齐和级联操作故障。
本研究提出一种混合架构KAN-MLP-Mixer,结合Kolmogorov-Arnold网络(KAN)的精度与多层感知机(MLP)的噪声鲁棒性和效率,用于基于IMU的人体活动识别(HAR)。在8个公开数据集上,混合模型相比纯MLP模型平均宏F1分数提升5.33%,显著优于单独的KAN和MLP基线。该策略还能一致提升其他先进HAR架构的性能。
本研究提出一种多智能体方法AgentNLQ,在BIRD基准上实现了78.1%的语义准确率,通过语义增强的架构表示和业务规则生成准确SQL查询,其关键创新包括优化编排器、先进架构增强方法,并证明了其跨域泛化能力。
本文提出Learn-by-Wire Guard(LBW-Guard),一种在AdamW之上运行的有界自主训练控制治理层,通过观察训练遥测、解释不稳定敏感区域并施加有界控制,在不替换优化器的情况下提升大型语言模型训练的稳定性和效率。在Qwen2.5系列模型上的实验表明,LBW-Guard可将7B模型的最终困惑度从13.21降至10.74(改善18.7%),同时端到端训练时间减少约10%。在强学习率压力下,AdamW完全退化,而LBW-Guard仍能保持可训练性,困惑度维持在11.57和10.33。
该研究评估了大型语言模型(Gemini 3.0 Flash)在提供个人健康记录(PHR)上下文时回答用户健康查询的能力。使用了2257个查询和1945份去标识化的PHR,比较了无上下文、基本摘要和完整临床笔记三种条件下的回答。结果表明,使用PHR数据后,所有类型查询的回答帮助性显著提高,并在安全性、准确性、相关性和个性化方面有所提升。同时,新开发的评估框架发现了LLM在理解复杂PHR时的不足,如时间混淆和罕见但重要的幻觉。
本文提出一种微服务架构,将分类、光学字符识别(OCR)和大语言模型结构化字段提取管线封装在一起,并分享了每小时处理数千份多页文档的生产经验。关键设计包括混合分类、GPU与CPU分离、异步I/O处理及独立水平扩展。批处理分析揭示两个意外发现:OCR主导端到端延迟,系统并发由共享GPU推理容量而非工作进程数决定。
一篇新立场论文提出开发“数据探针”——从适当定义的随机过程中生成的合成序列——以系统研究数据特征如何影响大语言模型性能。该方法旨在超越经验启发式,走向基础性理解。
制造业劳动力老龄化导致关键操作知识流失。本文探讨如何利用生成式AI将专家经验转化为结构化数字工作指令,从而减少缺陷、提高产量,并确保知识传承。
Google I/O 2026 发布了 Gemini 3.5 Flash(具备 100 万 token 上下文、65k 最大输出、四种思考级别和跨轮思考保留,现已正式可用)、Gemini Omni(用于视频生成和编辑的多模态系列)、Antigravity 2.0(包括桌面应用、CLI、SDK 和托管代理),以及 Search 中的生成式 UI 和后台信息代理。谷歌声称每月处理 3.2 万亿 token,同比增长 7 倍,Gemini 月活用户达 9 亿。
特德·姜在普林斯顿大学的演讲中探讨生成式AI与艺术的不兼容性,认为AI被资本主义用于榨取价值,而人文教育的目标是培养超越工厂工人的毕业生。他质疑AI对创意写作的帮助,比喻用ChatGPT写论文如同在举重房开叉车,并建议学生将作业视为脑力训练。此外,他称赞电视剧《安多》是对抗法西斯主义的深刻描绘。
AI治理并非减缓采用,而是实现规模化AI的关键。快速AI与安全AI的误判二分法通过认识到安全能通过信任加速部署而得以解决。
企业AI项目的高失败率源于缺乏专门优化AI系统的企业级架构。员工使用消费级聊天机器人导致敏感信息泄露。所谓的“氛围编码”生成大量漏洞代码,造成未来不可预测的安全隐患。
TechEx North America第二天聚焦AI和大数据,讨论了AI实验难以转化为持久系统的“AI墓地”现象,强调从实验到实际影响的转变。会议涵盖企业AI实施、投资回报、代理式AI、治理和信任等主题。
Ember是一个基准测试平台,通过365天的审计记录,使用Brier分数评估AI模型在Polymarket预测市场中的表现。
一份白皮书揭示,NVIDIA A100 GPU在报告利用率0%的情况下,功耗可达146.66瓦,暴露了GPU遥测中的关键盲点。作者提出新的能效基准(CEI)和开源优化器来检测此类“幽灵”异常。
AMD AI开发者大会首次落地上海,CEO苏姿丰指出AI正在重新定义计算的每一个层次,竞争焦点从模型能力转向系统工程与全栈优化。中国在开放生态中领跑,AMD持续加码中国开发者生态建设,提供从云端到端侧的全栈算力方案,以ROCm开源平台为核心,帮助开发者应对Agent时代的新挑战。
StartupStarter 是一个为创始人打造的AI原生操作系统,集成CRM、邮箱、智能体、文档、财务和融资于一体。其AI助手S2X能学习业务运作,自动化任务,如管理邮箱、草拟回复、处理交易、准备数据室等。平台还提供关系智能、自适应学习和持续信号处理功能。
随着AI可穿戴记录设备的兴起,隐私保护面临新挑战。从黑手党的反监听措施到现代技术对抗,文章探讨了监控与反监控的军备竞赛,并指出科技巨头可能在这场博弈中占据上风。
谷歌宣布首款AI智能眼镜将于今秋发布,与三星、Gentle Monster和Warby Parker合作。眼镜运行Android XR,配备摄像头、扬声器和麦克风,但无显示镜片。集成Gemini AI,支持识别物体、导航、通话、消息、音乐、拍照、实时翻译等多种功能,并能与iPhone配合使用。苹果自家AI眼镜预计2027年才推出。
本文展示了一份今日爬取Hacker News的用户代理列表,包括各类浏览器、搜索引擎爬虫、AI机器人以及自定义爬虫,反映了HN内容的广泛影响力。
Applied Compute 使用强化学习为企业(如 DoorDash、Cognition、Mercor)训练定制 AI 代理,并在 Modal 上运行。其核心理念是“特定智能”:通过专有数据训练,每次使用都能改进。本文介绍了他们的 RL 训练循环、基础设施选择以及 Modal 如何提供灵活性、性能和可靠性。
OpenAI推进教育国家计划,通过新的合作伙伴关系、教师培训和工具,扩大AI在学校中的应用,以改善全球学习成果。
Ramp工程师使用Codex与GPT-5.5进行代码审查,大幅缩短反馈时间,从数小时降至数分钟。