一项名为AgingBench的新基准测试揭示,已部署的AI智能体会通过四种老化机制随着时间的推移而退化,需要生命周期评估和针对性修复,而不仅仅是更强的初始模型。
AI 新闻实时情报
实时监测
实时更新
实时跟踪可信来源,保留出处、权限和站内阅读模式,把噪声压成可读情报。
实时更新
约束获取(CA)及相关研究因缺乏适当基准而进展受限。现有基准多为求解器设计,忽视领域知识工件。本文提出MPMMine基准套件,以一致性、标准化、完整性、可扩展性、开放性和版本控制为指导,采用MiniZinc、CommonMark和JSON开放格式,提供多模型、多实例及大量解与非解,并附有自然语言描述,以支持文本到模型方法。
arXiv新论文提出GEM(治理演化记忆)框架,将长期AI智能体记忆视为新的数据管理工作负载,通过状态级操作替代记录级数据库操作,解决当前记忆系统的四大缺陷。
一项新研究质疑大型语言模型是否具有真正的内省能力,认为现有证据可能仅仅是基于表面线索的模式匹配,而非真正的元认知监控。
BrickAnything是一种几何条件自回归框架,能从多种3D表示生成可构建的砖块结构。它使用点云作为统一几何接口,预测砖块序列以重建目标形状,并引入结构感知树标记化来建模依赖关系,配合偏好对齐、有效性约束解码和自适应回滚,显著提升了稳定性和几何保真度。
AI基础设施初创公司Fireworks、Baseten和OpenRouter正在筹集巨额资金,标志着推理基础设施成为关键的AI平台层。同时,智能体工程、新基准测试和模型更新主导了AI新闻周期。
一位独立开发者创建了Snipforge,一个包含28种工具的全能AI视频编辑套件,包括转录、智能剪辑、背景去除等功能。定价从免费到团队版每月15美元。
ACM CAIS 2026注册已满,但可加入候补名单。会议将于2026年5月26日至29日在圣何塞举行,设有主题演讲、63篇研究论文和46个系统演示,并已与AI工程师世界博览会合作。
ClearCompli 提供AI治理与合规洞察,帮助企业应对AI监管挑战。
DeepSeek研究员陈德里使用自研的DeliAutoResearch技能,与DeepSeek-V4-Pro和GPT-Image2合作,在6天内完成了一篇46页的论文。论文提出了L1-L5自主研究智能体分类体系,分析了四种架构模式和17个主流系统,并指出了六大开放问题。陈德里表示,人类仅需投入不到2小时的“CPU时间”,其余工作由AI Agent完成。
Hyper是一款AI驱动的个人知识管理工具,能从Notion、Obsidian等应用中整合上下文,提供智能辅助。创始人此前在Matic从事机器人研发,曾在2020年尝试改进GPT-2未果,如今推出自助版本。
分析显示,教皇利奥十四世关于人工智能的通谕《人间伟大》中部分段落可能由AI生成。AI检测工具Pangram指出,某些段落AI写作比例高达40%至100%,并存在AI生成文本的典型特征,如“genuinely”一词使用频率增加。然而,检测并非绝对可靠,其他部分被认定为人类写作。
谷歌最新无屏幕健康追踪器Fitbit Air售价仅100美元,是Whoop的强力竞争对手。经过一周的跑步、力量训练、瑜伽等测试,我们发现这款设备轻便舒适,电池续航约一周,配合AI健康教练提供全面的追踪体验。虽然无屏幕设计减少了干扰,但在运动中查看数据需要打开手机应用。订阅Google Health Premium可解锁AI教练的高级功能。
theta 是一个用 Rust 编写的 CLI 工具,用于管理代理配置。它读取 theta.toml 文件,解析、锁定、物化并转换代理配置到任何支持的 harness(如 Claude Code、Codex CLI、GitHub Copilot、Cursor),通过解决 .theta/ 文件夹中的资源来实现。它就像一个代理 harness 资源的包管理器。安装简单,支持添加规则、工具、技能和子代理,并提供验证和转换命令。项目深受 uv 启发,是 theta-spec 的标准实现。
一名东湾母亲接到诈骗电话,骗子使用AI和深度伪造技术模仿其女儿的声音,声称她被墨西哥贩毒集团绑架。这是利用AI技术进行诈骗的新趋势,当局提醒公众警惕。
教皇利奥十四世在其首道通谕《伟大的人性》中呼吁各国政府放缓人工智能系统开发,强调AI在战争中的使用必须受到最严格的道德约束,并谴责“正义战争”理论已过时。
本文探讨了防止AI被恶意使用的三大挑战:管辖权漏洞使不法分子可在无法律约束的地区活动;开源模型难以监控和限制;互联网匿名性阻碍了身份识别和追溯。作者呼吁在隐私与安全、开源与管控之间做出艰难权衡,并指出当前默认状态不可持续。
本文探讨了AI工具对工程师判断力的影响,指出被动使用会导致技能退化,而对抗性使用则能锻炼判断力。真正的技能不在于提示词,而在于提出质疑的能力。
Modal 为 Teams 和 Enterprise 用户推出了基于角色的访问控制(RBAC),围绕环境(Environments)构建,支持精细权限管理,确保智能体和人类的安全协作。
本周AI新闻要点:Anthropic公开了此前仅限国防承包商使用的顶级模型Mythos,使五角大楼级AI能力向开发者开放;DeepMind CEO哈萨比斯将AGI时间线提前至2029年;Starlette框架爆出严重认证绕过漏洞,影响数百万AI代理;CrowdStrike等联合摧毁Glassworm僵尸网络;法国巴黎银行与Mistral达成主权AI安全合作;中国限制阿里和深度求索顶尖AI工程师出境;Uber AI预算超支、ClickUp裁员并引入数千AI代理,同时MIT技术评论数据显示AI暴露岗位失业率更低,奥特曼撤回白领失业预言。
本文详细介绍了如何为Reachy Mini机器人部署完全本地的语音对话管道,无需云端或API密钥。采用级联方式,结合VAD、STT、LLM和TTS,推荐使用llama.cpp与Gemma 4、Silero VAD、Parakeet-TDT 0.6B v3 STT和Qwen3-TTS。提供了多种LLM运行选项,包括本地MLX、Transformers、vLLM或远程Responses API。
全球选举前夕,我们致力于帮助人们获取信息、支持网络安全防御者并提升AI透明度。
Warp 利用 GPT-5.5 和 OpenAI 模型,协调跨本地、云端和开源开发工作流的编码代理。
Daniel Stenberg近日透露,curl团队正承受前所未有的压力,因为AI辅助提交的可信安全报告数量激增,平均每天超过一份,是2024年的4到5倍。尽管报告质量极高,但curl代码稳固,发现的漏洞多为低或中等严重性,最后一个高危漏洞在2023年10月。
本教程详细介绍了如何使用zeroentropy/zerank-2-reranker(一个基于Qwen3的4B参数交叉编码器重排序器)来提升检索质量。内容涵盖环境搭建、模型加载、查询-文档对评分、使用model.rank进行排序、构建两阶段检索-重排序管道、NDCG@10评估以及跨领域(金融、法律、代码)性能测试,最后还进行了批处理吞吐量测试。
Stability AI发布了Stable Audio 3,这是一个潜在扩散模型系列,用于生成和编辑44.1 kHz立体声音频。该系列提供小型、中型和大型三种规模,其中小型和中型开源。关键技术包括高度压缩的SAME自编码器、可变长度生成以及结合流匹配、蒸馏和对抗性后训练的三阶段训练流程。该模型在音乐和音效基准测试中取得了最先进的结果,并支持基于修补的音频编辑。
随着AI向智能体方向演进,对CPU提出了新要求:快速内核、海量内存带宽以及全核高负载下的持续性能。Phoronix今日发布的基准测试结果显示,NVIDIA Vera CPU满足这些需求。Vera采用88个定制Olympus核心,1.2TB/s内存带宽,在功率效率内提供强劲性能。测试中,Vera在单插槽系统中展现了卓越的代码编译、文件压缩、视频转码等能力,并在STREAM TRIAD测试中实现了90%峰值带宽,远超传统x86 CPU。与上一代Grace相比,Vera性能提升1.6倍,在多项测试中领先于Intel和AMD的最新处理器。NVIDIA已向主要AI公司和云提供商交付首批Vera CPU,预计下半年通过合作伙伴上市。
尽管97%的电信高管正在评估或采用AI,但许多项目因“数据债务”——即分散、无治理且语义不清晰的数据——而停滞在规模化之前。NVIDIA的2025年报告指出,瓶颈并非模型质量,而是数据可用性。Databricks Unity Catalog通过统一的语义层和治理机制,实现跨系统数据联邦、细粒度访问控制和丰富的语义上下文,从而将AI从演示推向可信赖的生产系统。
Zero.xyz是一个免费工具,能让AI代理通过统一API访问超过4000种工具和服务,无需配置API密钥。它兼容Claude Code、Codex、Gemini等多种CLI代理,并提供5美元免费额度。
在 OpenAI 推翻 Erdős 单位距离猜想后不久,Anthropic 展示了 Claude Mythos 也能解决这一问题——且是在“周末内”。工程师 Sholto Douglas 称 Mythos 用一个“可爱、简单的证明”破解了 1946 年的猜想,这标志着 AI 驱动数学发现存在“严重过剩”现象。