本文提出了COD10K-C基准,基于COD10K数据集,包含8种损坏类型和5个严重级别,共计40种条件和81,040个评估对。评估了SINet-v2、PFNet、ZoomNet和轻量级模型RobustCODLite。所有模型在损坏图像上性能显著下降,运动模糊和高斯模糊影响最大。RobustCODLite采用损坏增强、频率先验分支和不确定性一致性损失,在损坏下保留92.3%的干净Dice分数,优于其他模型。该工作将开源以促进鲁棒伪装目标检测研究。
AI 新闻实时情报
实时监测
实时更新
实时跟踪可信来源,保留出处、权限和站内阅读模式,把噪声压成可读情报。
实时更新
一项针对Qwen3-14B隐藏状态的探测研究表明,线性探针在分类推理类型(演绎、归纳、溯因)时达到了100%的准确率,但实际上检测的是任务格式混淆因素(如来源、选项数量、响应长度),而非真正的推理模式。消除混淆后,准确率降至随机水平,因果干预实验也未发现功能关联。研究结果呼吁在机械可解释性中进行常规的任务格式去混淆。
针对大型语言模型代理在决策步骤中生成冗长文本推理的无效性,研究人员提出了自适应潜体代理推理(ALAR)框架。该框架采用双模式机制:常规步骤使用紧凑潜体推理,仅在需要深入思考时切换到显式链式思维。实验表明,ALAR在搜索任务中减少高达43.6%的令牌生成,在工具使用中减少84.6%,同时保持可比甚至更好的任务准确性。
受哈耶克市场理论启发,研究人员提出一种基于拍卖、支付和财富积累的智能体经济系统,使智能体无需集中控制即可自发形成集体智能。该系统在数学推理、金融研究等任务上超越了传统单体模型,为多智能体系统设计提供了新思路。
对自然语言到一阶逻辑(NL-to-FOL)基准FOLIO和MALLS的系统审计发现,约39%的FOLIO条目和36%的MALLS条目存在错误的FOL形式化。作者发布了修正后的标注,并提出了一个基于LLM的框架,可将人工审查工作量减少70%以上,在审查不到24%的实例后即可达到90%的数据集准确率。
研究人员引入了Padyam2Gadyam数据集,用于将13至17世纪的泰卢固语古典诗歌翻译成现代泰卢固语和英语散文。该数据集包含600首诗歌及其人工验证的翻译。评估了5种大型语言模型的表现,结果表明仍有较大改进空间。
研究显示,在法律、医疗等高风险场景中,即使单次对话历史也足以导致LLM输差异。尽管LLM难以从对话推断用户社会人口统计信息,但话题可部分代理该信息并不可预测地影响建议。
该研究探讨了大语言模型中词汇重叠对表征的影响,发现词汇效应贯穿模型各层,并在中间层出现语义和词汇信号同时退化的情况。研究还表明词汇影响会波及下游任务如摘要生成和模型编辑。
一项研究评估了31个大语言模型在环境态度方面的表现,发现许多模型比普通人类受访者更支持环保,但存在情境敏感性和谄媚行为等问题。
IdiomX是一个大规模多语言习语基准,包含超过19万条上下文示例,涵盖1.2万多种习语,支持英语、阿拉伯语和法语。它定义了四项任务:习语检测、上下文到习语检索、阿拉伯语到英语习语检索及习语解释。实验表明,Transformer模型提升了检测性能,混合检索架构增强了跨语言检索。
本文提出几何感知表格扩散模型(GATD),通过向扩散去噪器注入列值差异计算的成对角度和长度作为输入和辅助目标,显式捕获表格数据中的列间关系。MLP实例在10个数据集上以平均3.5倍更少参数(分类任务达25倍)达到最先进性能,分别赢得8/10的形状、7/10的趋势和9/10的下游效用指标,形状和趋势误差分别降低27%和20%。默认损失权重可迁移至GNN和Transformer去噪器,在27/30和25/30架构-数据集单元上改善形状和趋势。消融实验证明增益来自显式关系监督而非额外输入或容量。该工作表明显式关系监督是表格扩散的可迁移归纳偏置。
大型语言模型(LLM)作为持续演化的服务部署时,基础模型频繁更新会导致先前部署的任务特定低秩适配(LoRA)适配器失效。ReLoRA框架通过知识复用实现高效重新适配,快速恢复服务就绪的LoRA适配器,同时保持或提升任务性能。该框架包含自适应LoRA初始化和带调度正则化的微调两个关键步骤。实验表明,与基线相比,ReLoRA将准备时间缩短最高8.9倍,准确率提升最高4.6%。
提出StenCE框架,通过对比学习融合心电图(ECG)与冠状动脉造影特征,从ECG中检测严重冠状动脉狭窄信号,实现无创早期筛查。实验表明该方法在多种ECG编码器上均优于现有技术,首次实现高精度严重狭窄分类。
本文提出一个确定性气候风险智能框架,通过整合单一真相源编排、时间异常检测、不平衡感知集成学习和可解释性治理,解决ESG数据碎片化和缺乏可审计性的问题。框架包含合成基准、时间漂移分析、SMOTE优化、集成学习、TreeSHAP可解释性等,并与多种基线方法对比,结果通过分层五折交叉验证和显著性测试。该框架旨在建立可重复、可解释、可操作审计的确定性气候风险治理基础设施。
论文提出TopoMamSurv框架,针对全切片图像生存分析中Transformer计算瓶颈和Mamba对输入顺序敏感的问题,采用拓扑感知排序和双向Mamba模块,结合图卷积网络,实现高效的长程依赖建模和空间结构利用,在五个TCGA数据集上验证了性能优势。
研究表明,在数据集内类别分割评估中,当保留的异常类与正常混合在表示空间重叠时,异常分数可能退化甚至反转,且最优分数方向依赖于未知的异常类。作者提出了一种免训练的“邻域类泄漏”诊断方法,并在多个数据集和特征空间上验证了其对分数方向不稳定性的预测能力。结论是,类别分割异常检测基准应被视为几何依赖的应力测试,而非无条件的检测能力证明。
研究人员提出一种轻量级CNN,以防御针对基于EEG的脑机接口的对抗性攻击,实验表明其鲁棒性优于现有模型。
该论文提出了谱对齐分解,解释了神经网络损失景观中曲率指数α为何在不同层类型间变化(卷积层约2,Transformer注意力层约1,MLP上投影层小于1)。该分解将α的变化归因于Kronecker因子特征基与梯度奇异方向之间的对齐程度。此外,论文推导出一个谱传递恒等式s=αγ,通过独立拟合α和γ可高精度预测Hessian衰减指数s。基于此,研究者提出架构自适应预条件子T(σ;α),并展示Spectral Newton优化器在视觉基准上超越AdamW。
短租市场动态定价面临财务风险高、需可解释性、反馈稀疏等挑战。本文提出人机协同门控情感老虎机(HITL-GB)框架,算法给出价格建议,人类运营人员有权接受、修改或拒绝。研究表明,在审批约束下,历史定价数据(来自先前确定性策略)在结构上等同于用于初始化情感老虎机后验的在策略预热数据,从而避免数周至数月的冷启动期。在真实短租生产数据(匿名城市市场,2间房,2022年4月至2026年4月,1461个夜间定价场景)上验证,预热程序将有效冷启动从约150个场景压缩至约30个场景。该方法可推广至临床用药、信贷发放、内容审核、放射诊断等高风险的监管领域。
本文介绍GAMBLe框架,用于分析AI驱动研究系统(ADRS)。该框架将ADRS行为分解为四个参数(生成器、评估器、发现机制、预算)和一个有效景观。通过760多次实验发现,不存在完全的排序,正确的组件选择可大幅提升性能。
本文提出一种用于嵌入式代理系统的模块化参考架构,通过分层设计将设备端代理与云端增强代理解耦,并引入跨层治理层,以解决在资源受限的微控制器上部署大型语言模型(LLM)的挑战,实现实时控制与自主智能的融合。
大型推理模型通过增加推理步骤提升性能,但研究表明,在获得正确答案后继续推理可能导致偏离,引入有害过度思考的概念。通过前缀轨迹评估,发现早期停止正确推理可提升准确率高达21%,而常见效率策略无法缓解有害过度思考。
本文探讨了三种基于玩家碰撞信息生成敌人形态的新方法,旨在填补视频游戏程序化内容生成中敌人形态生成的空白。研究发现每种方法各有优劣,但均优于或等同于从机器人形态学改编的进化基线。
本文介绍Traj-Evolve,一个自进化的多智能体系统,通过经验池(ExPool)和多智能体强化学习(MARL)从纵向电子健康记录中建模患者轨迹,在肺癌预测任务上超越9个强基线。实验表明,ExPool提升特异性,MARL提升灵敏度,两者互补。
ChatHealthAI是一个多模态推理框架,通过任务感知重采样器将预训练的EHR基础模型的结构化表示与冻结的大语言模型语义空间对齐,从而在保留预测性能的同时实现可解释的自然语言临床推理。在EHRSHOT基准的三个临床预测任务上,该框架在保持竞争性预测性能的同时,显著提升了推理质量和可解释性。
一项新研究比较了编码器 Transformer 和 LSTM 在无测站流域进行上游径流推断的性能。结果表明,LSTM 整体表现优于 Transformer,而结合下游信息可令中位数 NNSE 提升超过 60%。研究认为,递归记忆架构更适用于此类地形序列推理任务。
AURA-Mem是一种针对机器人策略的恒定大小循环记忆,通过动作门控机制仅在观察改变未来动作时才写入,显著减少内存写入次数,同时保持准确性。在合成基准和真实机器人任务中,AURA-Mem匹配或超越基线,且内存占用恒定(4,224字节),远小于KV缓存。
MIT和MIT-IBM计算研究实验室的研究人员开发了ChartNet数据集,包含超过一百万张多样化图表,用于训练视觉语言模型。该数据集使小型开源模型在图表理解任务上超越大型商业模型,有望帮助预算有限的小型企业更有效地利用AI。
Dropstone 1.5 是一款终端中的AI编程代理,每月重新评估顶级模型并切换至最佳者。当前基于DeepSeek和Kimi模型,美国服务器托管,不存储数据。每月15美元提供约450次深度编程会话,约为Claude Code Pro的两倍(后者20美元)。注重安全,所有操作需确认。
一项新研究探讨了AI编码代理与传统人类程序员在错误消息消费上的差异,通过控制实验发现,更详细的类型错误消息能显著提升AI代理修复错误的能力,并且类型系统的存在优于仅依赖测试套件失败报告。