大型语言模型在通用任务上表现出色,但难以适应专业领域。本文提出自主代理数据工程任务,让LLM作为自主数据工程师,通过端到端数据策划驱动模型专业化。实验表明,GPT-5.2通过迭代代理驱动的数据适应,将学生模型性能提升57.29%。
AI 新闻实时情报
实时监测
实时更新
实时跟踪可信来源,保留出处、权限和站内阅读模式,把噪声压成可读情报。
实时更新
本文提出了一种评估ChatGPT生成疾病相关生物医学关联能力的协议。该协议概述了如何生成关联、利用生物医学本体验证生物实体以及通过文献验证关联。协议包含跨ChatGPT模型的自一致性策略以评估生成可靠性,并通过检索增强生成(RAG)结合开源大语言模型实现语义验证,从而揭示幻觉现象。
本文正式定义了标签排序中的校准概念,开发了涵盖全排序、子排序和top-k排序的层次结构,证明全排序校准蕴含其他但反之不成立,且子排序和top-k校准不可比。实验发现流行标签排序模型校准不佳,且校准与RLHF奖励模型的基准准确性强相关但不完美,揭示了超越top-1准确性的重要质量维度。
现有基准测试大多评估孤立或短期的交互任务,未能测试智能体在长时间跨度内追踪不断变化的分析上下文的能力。为此,研究者提出了LongDS基准,包含68个源自真实Kaggle笔记本的任务,涵盖2255轮交互,涉及六大领域。评估发现,最佳模型平均准确率仅为48.45%,从早期到后期性能下降近47个百分点,长期错误占失败原因的52%-69%。额外步骤不一定提升性能,关键瓶颈在于维持正确的分析状态。
本文提出NumLeak框架,用于检测基础模型对公共数值基准的记忆。顶级LLM能够高精度回忆训练数据中的精确数值,造成虚假的准确性印象。实验表明模型对金融经济数据的相关性高达0.99,但在近期发布的数据上表现骤降。白盒logprob分析比开放式生成更能检测记忆,简单系统提示防御可阻止大多数攻击。
本论文提出了一种名为海事异常检测质量指数(MADQI)的新复合指标,用于无需标记数据即可评估无监督学习模型在海事自动识别系统(AIS)数据中的异常检测性能。该框架整合了四个指标:异常率一致性(ARC)、物理合理性分数(PPS)、分数分布分离度(SDS)和极端案例证据(ECE),并通过多块评估和自适应缩放进行自动归一化。实验显示MADQI得分80.37%,其中ECE和ARC分别达到0.907和1.000,表明该框架在检测极端异常和保持异常率一致性方面表现出色。
提出了一种名为双频谱流匹配(DSFM)的新型fMRI生成框架,通过级联离散小波变换和离散余弦变换捕捉BOLD信号的多尺度瞬态变化和低频能量压缩,再通过频谱流匹配生成类条件余弦频率表示,经逆变换重建生理上可信的时间序列,显著提升了脑网络分类性能。该工作已被ICLR 2026接收,代码已开源。
本文介绍了一种基于径向基函数(RBF)网络的新型大语言模型架构,该架构无需深度神经网络,通过闭式解一次性找到损失函数的全局最优解,消除了繁琐的训练步骤,提高了可解释性和准确性。
本研究通过五种Transformer模型的LoRA微调,引入了一种多模型范式来研究合成欺骗。线性探针能在早期层以接近完美的AUC检测欺骗,且逻辑回归探针优于MLP,支持线性表示假说。跨领域泛化能力强,但不同模型表现出不同的表示退化模式。研究表明,通过适度的监督微调可以快速巩固鲁棒的、领域不变的欺骗表示,对激活监测有重要影响。
Unicorn框架通过潜在原型码本解耦通道相关性与特定身份,实现跨异构数据集的可扩展预训练,在少样本迁移场景中显著优于现有方法。
研究人员提出了一个深度学习框架Gait2Hip-60,利用LSTM、Transformer和Mamba等模型从步态运动学直接预测髋部肌肉力和关节力矩。在60名健康受试者的基准测试中,Transformer表现最佳,并在零样本测试中对股骨头坏死患者保持中等预测能力。该研究为临床快速评估髋部动态提供了新方法,但需进一步病理验证和泛化改进。
量子计算仍处于含噪声中等规模量子(NISQ)时代,性能受噪声严重制约,需要硬件级功能如中电路测量、经典反馈、精确时序控制和脉冲级波形访问。OpenQASM-3提供了这些接口,但缺乏针对其硬件特性训练大语言模型(LLM)的数据集。为此,研究者推出QASM-Eval,首个全面覆盖OpenQASM-3硬件特性的数据集,包含100个专家验证的测试任务和4000个训练任务,涵盖经典逻辑、时序调度、脉冲控制和复杂工作流,并配有扩展验证器。评估显示,现有LLM在OpenQASM-3编码任务上表现困难,而针对QASM-Eval的微调可显著提升性能。该数据集为NISQ时代硬件级量子编程的可靠LLM助手开发提供了关键基准和训练基础。
MAVEN(模块化智能体验证与执行网络)是一种轻量级符号推理框架,旨在通过结构化分解、自适应工具编排和中间验证来增强智能体在工具调用环境中的泛化能力。在MAVEN-Bench压力测试中,MAVEN将GPT-OSS-120b基础模型的准确率从48%提升至71%,且无需额外训练。该框架在使用开源模型的情况下,成本仅为专有模型的1/10,展现了轻量级验证中心框架在组合推理方面的潜力。
现有AI医疗基准固定了提供者响应,无法评估机制产生的均衡。该研究将医院机制设计重新定义为语言模型的程序合成,通过多智能体模拟器Medi-Sim和进化代码搜索,实现了消除过度编码、减少拒绝并保留大部分资金的可解释混合目标程序。
本文提出了三种重路由器设计,通过隐式分解子任务来增强基于子目标的策略树搜索,避免了显式子目标生成的开销,在复杂环境中实现了最先进的在线训练效率。
EHRBench是一个自动化和可靠的基准测试,利用电子健康记录(EHR)数据,通过EHR-LLM-知识库交互流程,生成了近100万个问答项目,涵盖诊断、治疗和预后三大临床决策任务,并在30多个大型语言模型上进行了评估,揭示了当前LLM在临床可靠性方面的差距。该研究已被KDD 2026收录。
LLM代理通过更新外部装备(如提示、技能、记忆和工具)来适应任务,但模型的基础任务解决能力是否能预测其装备自我进化能力尚不明确。研究发现,装备更新能力与基础能力无关,而装备收益能力则呈现非单调性:中等模型受益最大,弱模型和强模型受益较少。建议将能力预算投入任务解决代理而非进化器,并注重装备调用和长程指令遵循的训练。
一篇arXiv研究论文探索了使用MAP-Elites(一种质量多样性算法)程序化生成第一人称射击(FPS)游戏地图。作者引入了两种新的地图表示方法(点线表示法和空间布局表示法),并定义了一系列拓扑和涌现属性指标。使用带有滑动边界的MAP-Elites(MESB)进化地图,结果显示新表示法能够生成比以往方法更多样化、更高质量的地图。
本文研究如何将因子化任务(FTS)编码为SAT问题,提出了多种编码策略,并分析了任务转换和并行性对基于SAT的规划器性能的影响。
PhyDrawGen是一种神经符号管道,可从文本生成物理图,严格遵循物理定律。它先由大语言模型提取场景图,再由确定性求解器转换为平面直线图,最后通过微调Qwen-VL模型进行验证。在1449个物理问题基准测试中,其物理准确性显著优于GPT-5-image等模型。
PayPal和Palantir联合创始人彼得·蒂尔认为,人工智能对数学和编程等STEM领域的威胁大于对创意和沟通类岗位的影响。LinkedIn报告显示,沟通和领导力成为最受欢迎的技能,部分公司为故事讲述者提供高薪。同时,一些STEM专业的失业率较高,但并非所有技术岗位都面临风险。蒂尔还指出,AI可能使医学等领域的数学门槛变得不再必要。
Mistral Vibe是一款AI代理,专为长期运行的多步骤工作和编程任务设计。本文介绍其功能及在Product Hunt上的讨论。
近日,Instagram曝出一个严重漏洞,攻击者可以利用Meta AI助手绕过多因素认证,直接重置账户密码。该漏洞已被修复,但引发了关于AI集成安全性的担忧。
Smart Rename 是一款开源工具,利用本地 AI 模型(llava)实时监控文件夹,自动为图像文件生成描述性名称。它完全离线运行,保护隐私,并通过系统托盘图标提供便捷控制。
知名YouTuber PewDiePie宣布推出一个基于OpenCode构建的AI工作空间,旨在帮助创作者更高效地利用AI工具。
MiniMax 发布了其多模态基础模型 MiniMax M3,支持文本、图像和视频输入,拥有 1M 令牌上下文窗口,专为长时间代理任务、编码和工具使用设计。该模型采用 MiniMax 稀疏注意力机制,在长上下文处理中大幅降低计算成本,并已登陆 OpenRouter 平台,提供有竞争力的定价。
本指南详细介绍了如何使用TestFlight测试iOS、iPadOS、macOS、tvOS、visionOS和watchOS应用的测试版。包括安装步骤、系统要求、自动更新管理以及如何测试不同构建版本。
英国内政部宣布在英吉利海峡移民入境点试行AI面部年龄估算技术,引发人权组织强烈批评。文章指出,该技术存在严重的准确性问题,对非白人、女性及在恶劣条件下拍摄的青少年误差更大,且可能违反法律要求。替代方案如Merton合规年龄评估虽耗时但更为可靠。
Moxie Docs 为 GitHub 仓库创建实时文档,并通过 MCP 为 AI 代理提供上下文,同时支持可搜索的工作区和 PR 检查以保持文档准确性。
本期涵盖Anthropic秘密提交S-1表格启动IPO,并发布Claude Opus 4.8,代码可靠性提升4倍;NVIDIA在GTC台北大会上宣布Cosmos 3开源、Vera Rubin投产及RTX Spark笔记本AI计算;Google退役Gemini 2.0 Flash;加州SB 867法案通过禁止儿童玩具中的AI伴侣聊天机器人,伊利诺伊州数据中心监管法案受阻。