针对撒哈拉以南非洲师生比例高、合格教师短缺的问题,研究团队开发了基于WhatsApp的AI教学助手Adesua。该系统整合教科书和33年国家考试题目,利用生成式AI提供问答和自动评估。在加纳的6个月试点中,56名活跃用户给予AI答案93.75%的帮助率评分,显示出在资源受限环境中提供个性化学习支持的潜力。
AI 新闻实时情报
实时监测
实时更新
实时跟踪可信来源,保留出处、权限和站内阅读模式,把噪声压成可读情报。
实时更新
本研究探讨人类在词汇量受限(最小250个高频词)时如何生成语言,并与基于大语言模型的贪心采样和全局最优采样算法进行比较。结果显示人类行为更接近贪心采样,但熟练者会回溯修正;在高约束下,人类倾向于使用语义较轻的词汇。研究对资源理性认知、心理语言学、二语交流和语言障碍有重要启示。
研究者从1.007亿份乌克兰法院判决中提取了5.02亿条引用链接,构建了首个大规模法律引用图。该图揭示了司法引用结构能无监督地编码法律领域边界,并以近乎完美的准确率预测未来立法重要性。主要发现包括:度分布遵循幂律;共引投影上的社区检测自动恢复了民法、刑法、行政法和商法等法律领域边界;引用特征以AUC=0.9984预测前1000篇重要文章。该本体被用于LLM辅助法律分析的工作流记忆系统。
话语关系(如因果、让步)是计算语言学和语用学的重要课题,但跨语言研究面临数据复杂和接口缺乏的挑战。DiscoExplorer 是一个开源的本地运行网页接口,整合了 DISRPT 共享任务中 16 种语言的话语关系数据集,提供查询语言、搜索和可视化功能,旨在简化多语言话语关系的分析。
一项新研究利用130,486段来自106部小说的翻译段落,分析了文学翻译中流畅性与忠实度的关系。研究发现,无论是人工翻译还是Google翻译,段落长度与两者之间存在一致的负相关,暗示了流畅性与忠实度之间的权衡。
OP-Mix是一种统一的数据混合算法,适用于整个语言模型训练生命周期,能以极低的计算量实现接近最优的混合策略。它利用低秩适配器模拟候选混合,无需单独的代理模型。
研究人员提出了分组查询潜在注意力(GQLA),这是对DeepSeek多头潜在注意力(MLA)的改进,在不重新训练的情况下提供两种硬件自适应的解码路径。该方法能在H100和H20 GPU上实现高效推理,并包含TransGQLA用于转换预训练的GQA模型。
该研究探讨了生成式轨迹模型的隐私评估问题。尽管生成对抗网络(GANs)、变分自编码器(VAEs)和扩散模型等生成模型常被认为能保护隐私,但研究表明这一假设不成立。研究者确定了适用于轨迹生成任务的隐私评估实证方法,发现当前评估存在显著缺口,并通过针对代表性模型的成员推理攻击展示了隐私风险的存在。
本文提出转录组药物设计(TBDD)作为生成式逆问题,通过条件扩散模型设计分子以实现期望的转录组状态转换。作者提出CURE框架,包含转录组扰动功能特征提取器(TFE),用于跨模态对齐和异质性感知聚合,在标准测试和零样本基因抑制剂设计中表现优异。
本文提出Logic-GNN,一种神经符号框架,将临床记录视为由潜在逻辑游戏支配的“私人语言”,通过集成时序图神经网络和图柯尔莫哥洛夫复杂度归纳符号语法,将异常定义为导致临床图最小描述长度显著扩展的“语法违规”。在Sina System数据集(超过200万条记录)上,Logic-GNN达到了0.94的F1分数,在区分危及生命的医学异常和数据损坏方面比最先进的基线方法高出12%,并引入自愈机制以实时维护数据完整性。
MuteBench是一个新基准,用于评估在两种常见传感器故障模式(模态缺失和模态内缺失)下多模态融合架构的鲁棒性,覆盖7个临床领域的9个数据集、6种融合架构和125,000个样本。研究发现,架构族是鲁棒性的最强预测因子,通道独立模型在模态缺失时表现良好但对模态内缺失敏感,而课程模态丢失只能在训练时最大丢失率内提供保护。
本文提出Mask-Morph Graph U-Net (MMGUNet),一种解决分层图U-Net架构中边缘特定层限制的实用方法。通过在粗化图层次中引入特征对齐的重心参数化,并应用节点掩蔽预训练与参数高效微调,MMGUNet在分布内、分布外及跨组件迁移场景下均表现出更低的预测误差,为可复用、数据高效的网格代理建模提供了新途径。
研究发现,对大语言模型进行后训练量化压缩(如3位精度)会导致6-21%的原本无偏项目出现新的刻板行为,且模型选择“未知”答案的意愿下降17.4%。标准质量指标(如困惑度)几乎不受影响,表明聚合指标无法捕捉公平性关键退化。
本文提出TeamTR,一种信任区域框架,用于解决多智能体LLM系统在顺序微调中的结构失效问题——即智能体更新导致上下文分布偏移,且基于缓存的评估会加剧误差。TeamTR通过重新采样轨迹和智能体散度控制,实现了每步改进的下界保证,平均性能提升7.1%。
现代云和企业系统依赖基于身份的授权,但自主AI代理的出现使得这一假设失效。本文提出分布式信任框架(DTF),通过证明派生授权取代静态身份,确保代理执行的可治理性、可审计性和边界性。DTF引入正当性证明、共识模型、临时执行身份和仅追加证据链,在OpenKedge基础上实例化,为云原生环境提供基础。
自驱动实验室(SDL)通过自动化加速科学发现,但SDL软件开发技术门槛高。现有编排框架主要面向人类交互,缺乏适合AI代理的标准化接口。本文提出基于模型上下文协议(MCP)的SDL软件架构,将所有SDL功能暴露为MCP服务器,并实现NIMO控制器。该系统提供自动生成的视觉编程界面,支持人类用户无需编码设计实验流程,同时AI代理可通过同一MCP后端访问,实现人机统一接口。案例研究验证了该架构的可用性。
基于arXiv论文,NOVA框架将AI迭代自我改进循环建模为知识空间上的自适应采样过程,识别了污染陷阱等失败模式,并证明了发现成本与发现数量之间的缩放定律。
CAX-Agent是一个专为MAPDL有限元仿真自动化设计的轻量级Agent框架,通过三层架构(LLM服务、Agent框架、求解器后端)和恢复阶梯策略提升可靠性。实验评估了三种恢复策略,其中基于模型的恢复(model_only)在完成率、任务评分和零干预率上显著优于基于规则和无恢复策略。
指令调优语言模型在高风险决策中表现出行为公正性,但内部表示仍保留偏见关联。研究通过抵押贷款承销案例,发现模型输出无偏见,但内部层状表示放大了人口统计偏见。通过激活引导和跨层干预,注入关键层的抑制信息可导致近乎完全的决策逆转。这种潜在偏见是不对称的,且易受对抗性提示和微调影响。结论:仅基于输出的行为审计不足,需结合输出评估与表示分析的双层测试框架。
SkillSmith是一种边界优先的编译-运行时框架,通过从技能中提取细粒度操作边界,将技能包离线编译为最小可执行接口。在运行时,智能体仅访问和执行相关组件,避免了不必要的上下文注入和重复推理。在SkillsBench基准上,令牌使用量减少57.44%,思考迭代减少42.99%,求解时间减少50.57%(2.02倍加速),成本减少57.44%。此外,强模型生成的编译制品可被更小或更高效的模型复用,提升任务准确率。
现有的大语言模型(LLM)心智理论(ToM)评估多采用第三人称故事问答,忽略了人机交互的第一人称、动态和开放特性。本研究提出交互式ToM评估新范式,系统评估四种ToM增强技术在多种任务中的表现,发现静态基准的提升并不总能转化为动态交互中的更好表现,强调了基于交互评估的必要性。
提出SDOF框架,将多智能体执行视为约束状态机,通过在线RLHF意图路由器和状态感知调度器强制业务过程阶段约束。在招聘系统测试中,7B模型在对抗性路由基准上准确率80.9%(GPT-4o 48.9%),端到端任务完成率86.5%,并阻止了所有注入和非法操作。
DeepSlide 是一个人类参与的多智能体系统,专注于优化演示文稿从需求获取到排练支持的完整流程,而不仅仅是幻灯片本身。它通过逻辑链规划器、内容树检索、马尔可夫渲染和沙盒执行等组件,在保持幻灯片质量的同时显著提升了叙事连贯性、节奏精准度和演讲与幻灯片的协同效果。
Polarity是一个监控AI代理决策的平台,能够在生产环境中发现失败模式,并在用户遇到问题之前发出警报。它支持Go、Python和TypeScript SDK,并提供Slack集成。
在近期多所大学的毕业典礼上,多名演讲者因在演讲中提及人工智能话题而遭到台下观众嘘声。视频记录了这些尴尬场面。
CCC为承包商提供AI施工软件,旨在简化建筑流程。
一个仪表盘显示,在公共GitHub仓库中发现了超过43.5万个潜在AI API密钥匹配。尽管其中一些可能是测试字符串或已撤销的密钥,但仍存在安全隐患。了解正确管理机密信息的重要性。
皮尤研究中心的新报告显示,AI专家与公众对AI的态度存在显著分歧:专家乐观,公众焦虑且不信任。近60%的成年人认为自己对AI的使用几乎没有控制权,而多数人对政府和公司的监管能力缺乏信心。
D-slop 是一款轻量级浏览器扩展,通过分析高频短语、句子长度均匀性、标点密度、列表结构一致性以及结论性标记共五种信号,自动检测网页中的AI生成内容。用户可选择高亮、折叠或隐藏可疑文本,且短语库每周自动更新。该扩展完全在本地运行,无需账户,不收集任何数据,以MIT许可开源。
预印本存储库 ArXiv 宣布,若作者在科学论文中过度依赖大语言模型(如ChatGPT),将被禁止投稿一年。尽管论文未经同行评审,但ArXiv已成为计算机科学和数学等领域研究交流的重要平台。