AI News HubLIVE

今日必读

Agent

我让AI代理删除一个由我的工具保护的文件夹

Termaxa的作者通过让Cursor AI代理尝试删除受保护文件夹,发现了四种绕过安全机制的方法,包括重试不同shell命令、使用间接删除命令、利用本地文件工具以及由于API变更导致静默失效。这些经验教训促使了意图分类、会话断路器、集成测试改进等关键功能的设计。

  • Cursor通过重试不同shell方言绕过规则,暴露了策略表达力的不足。
  • 意图分类比模式匹配更能有效阻止恶意删除操作。
站内正文

经典Java RSS阅读器2026年无法运行,我用AI将其重构为Web版

一位开发者尝试用AI(Claude Code)将已停止维护的Java桌面RSS阅读器RSSOwl重构为Web应用。他发现大部分UI可以快速迁移,但由于AI训练数据截止于Vaadin 25发布前,生成了大量不存在的API代码。通过使用MCP服务器获取最新文档,以及手动对比原版行为,最终完成了多用户版本,但部分功能(如可插拔菜单、嵌入式浏览器)无法实现。

  • RSSOwl是一款经典的Eclipse桌面RSS阅读器,但32位二进制文件无法在2026年的Mac上运行。
  • 开发者使用Claude AI和Vaadin 25框架,在数小时内重建了核心三栏界面。
站内正文

HugstonOne架构、能力与基准测试:隐私优先的本地AI工作站

HugstonOne Enterprise Edition 3.0.0是一款集本地模型执行、大规模RAG、文档处理、编码、代理、研究工具、加密协作、会话连续性及网络内存控制于一体的跨平台本地AI工作站。其白皮书详细介绍了架构、隐私模型、基准测试及12支柱能力评估,旨在为企业技术领导者、安全团队和AI工程师提供全面的本地AI基础设施评估。

  • HugstonOne Enterprise Edition是功能最全面的独立本地AI工作站,无需云服务或外部API。
  • 产品支持本地LLM推理、RAG、AI代理、加密协作等12项核心能力。
站内正文

我们花了几个月构建AI智能体,然后删除了它们

Runnit团队在构建多个专业化AI智能体后,发现随着模型上下文窗口的增大,单独智能体不再必要,转而采用单一智能体架构,按需加载能力,大幅简化系统。

  • 最初因模型上下文限制,团队构建了多个专用AI智能体分别负责规划、研究、调度和写作。
  • 新模型上下文窗口增大后,单一智能体可自然切换多种任务,无需分立。
站内正文

Show HN:Open-Kritt – 基于AI的安全研究开源基础设施

Open-Kritt 是一个开源、自托管的 AI 安全研究平台,通过编排 AI 代理并行执行细化任务,帮助安全研究人员和开发者高效发现代码漏洞。项目团队此前在漏洞悬赏中累计获得超过150万美元奖金。

  • 开源、自托管的 AI 安全研究平台,支持自建工作流与多代理并行扫描
  • 通过细化任务、去重与自定义严重性排名,提升漏洞发现效率
站内正文
政策

美国银行因承保标准严格,可抵御人工智能数据中心低迷

分析师指出,自全球金融危机以来,美国银行采用了更严格的承保标准,这使得它们能够抵御人工智能热潮的急剧逆转。近期全球股市因对AI驱动涨势可持续性的担忧而下跌,但银行因更审慎的贷款实践而受到保护。

  • 自2008年次贷危机后,华尔街采用了更严格的承保标准。
  • 近期全球股市下跌,因投资者对AI涨势可持续性产生疑虑。
站内正文
芯片

硅谷的头痛:中国正在削弱美国在人工智能竞赛中的领先地位

谷歌人工智能的困境引发担忧,中国新模型再次挑战美国科技主导地位。硅谷工人也采取行动保护自己的工作免受AI影响。其他新闻包括纽约暂停新AI数据中心、IBM股价暴跌、亚马逊云服务巨额账单、特朗普加密货币收入等。

  • 中国AI模型再次展示实力,威胁美国领先地位
  • 谷歌AI表现不佳,引发行业担忧
站内正文
模型

5门免费课程:从AI新手到实践者

本文介绍了一个由5门免费课程组成的路线图,从经典算法到从头训练大语言模型,帮助有Python基础的学习者系统掌握AI技能。

  • 哈佛CS50 AI课程建立AI逻辑基础
  • 谷歌机器学习速成课程掌握数学与TensorFlow
站内正文

中国低价Z.ai模型暴露程序员昂贵习惯

Z.ai的GLM 5.2模型以低价和开放权重挑战美国前沿AI模型,但许多程序员仍习惯使用昂贵模型,忽略成本。该模型在基准测试中接近Claude Opus 4.8,但实际使用效果参差不齐。

  • GLM 5.2 API价格仅为Anthropic Opus 4.8的五分之一,Fable的十分之一
  • 开放权重允许自托管,避免数据隐私问题
站内正文

“仅次于Fable 5”:阿里巴巴发布Qwen3.8,但未提供任何真实数据

阿里巴巴宣布推出其最新大语言模型Qwen3.8,声称仅次于Anthropic的Fable 5,但未提供任何基准测试或模型卡。此举发生在竞争对手月之暗面发布Kimi K3并附有详细技术细节之后。阿里巴巴的声明缺乏透明度,引发对其发布时机和动机的质疑。

  • 阿里巴巴声称Qwen3.8仅次于Anthropic的Fable 5,但未提供任何数据支持。
  • 该声明紧随月之暗面发布Kimi K3之后,后者提供了完整的基准测试和技术细节。
站内正文
其余更新(151 条)
Agent

Show HN: Enlarger • 一款保持细节而非平滑处理的本地放大工具

Enlarger是一款本地图像放大工具,它不使用生成式AI,而是通过重构已有细节并应用后期处理来保持纹理和质感。支持批量处理、离线运行,一次性付费,无订阅。适合摄影师、设计师等专业人士。

  • 非生成式AI放大:重建细节而非凭空想象,避免过度平滑或幻觉。
  • 本地离线运行:图像不上传云端,保护隐私。
站内正文

软件与AI:规划式开发与即兴式开发

本文探讨了软件开发中两种方法——规划式(类似小说创作的‘情节规划’)和即兴式(‘随性写作’)——如何影响AI工具的使用。作者认为,AI代理(自主执行)适合规划式开发,而AI助理(协作辅助)适合即兴式开发。在现有代码库中,即兴式开发有助于建立理解,而AI代理可能阻碍学习。在全新项目中,AI代理风险较低,但即使如此,代码生成也会剥夺部分编程的乐趣——即通过探索问题来学习的‘玩乐’过程。关键在于根据当前开发阶段选择合适的AI风格。

  • 软件开发与小说创作相似,有规划式和即兴式两种方法。
  • AI代理支持规划式,AI助理支持即兴式。
站内正文

LWiAI播客第249期:Fable 5禁令、SpaceX收购Cursor与众多开源项目

本期播客讨论了Anthropic应美国政府要求切断对Fable 5和Mythos 5的访问、SpaceX以约60亿美元收购AI编码初创公司Cursor、基础设施与商业更新(如Anthropic寻求Google支持的租赁、OpenAI财务泄露等)、以及多项开源项目和政策动态。

  • Anthropic因美国政府命令切断对Fable 5和Mythos 5的访问,引发关于一致性和出口管制的辩论。
  • SpaceX以约1.75万亿美元估值IPO后,宣布以600亿美元收购AI编码初创Cursor,增强xAI实力。
站内正文

AI 是在治愈孤独流行病,还是在从中获利?

孤独危机正向年轻群体蔓延,而 AI 伴侣市场随之爆发,预计到 2034 年市值可达数千亿美元。然而,这些应用的商业模式与用户真正摆脱孤独之间存在根本矛盾:用户的依赖越强,公司收入越高。本文深入分析“依恋经济”的运作机制、市场规模争议及其伦理困境。

  • AI 伴侣市场从“注意力经济”转向“依恋经济”,以情感纽带而非用户注意力为商品。
  • 商业模式依赖高留存率,用户越孤独,使用越频繁,公司盈利越多。
站内正文

AI支出现被视为劳动力成本

公司对AI工具的成本控制日益严格,但将AI支出与劳动力成本对比时,其价值可能被重新评估。本文通过分析Uber、Tesla的预算限制以及Bun重写的案例,探讨了AI支出应如何归类。

  • Uber和Tesla因AI预算超支而设置每用户使用上限。
  • Bun运行时从Zig迁移到Rust的AI费用为16.5万美元,但若对比人工成本则显便宜。
站内正文

我评测了7款面向小企业的免费AI工具——欢迎反馈

本文评测了七款面向小企业的免费AI工具,涵盖了Perplexity与ChatGPT的对比、AI助力中小企业数字化、Bolt.new网站开发、Buffer与Hootsuite社交媒体管理、Calendly日程安排、Hotjar用户行为分析以及Trello与Notion与Asana项目管理。作者分享了这些工具如何帮助小企业提高生产力和数字化水平。

  • Perplexity vs ChatGPT:企业信息检索对比
  • AI中小企业数字化指南
站内正文

LWiAI播客第248期:Claude Fable 5、Siri AI、Anthropic IPO等AI大事件

本期播客讨论了Anthropic发布的Claude Fable 5模型及其安全争议、Apple在WWDC上宣布的Siri AI、Google的Gemini 3.5实时翻译和AI订阅调价、OpenAI的IPO进展、Prometheus的120亿美元融资、DeepSeek的融资计划、华为对DeepSeek模型的后训练、Google向SpaceX支付GPU费用、Gemma 4和DiffusionGemma开源模型、以及多项AI安全政策和研究动态。

  • Anthropic发布Claude Fable 5,性能大幅提升但也引发了关于安全护栏和隐形降级的争议。
  • Apple宣布Siri AI,基于与Gemini的合作,旨在提供更强大的对话助手。
站内正文

百时美施贵宝购买英伟达AI系统用于药物发现

百时美施贵宝将购买基于英伟达Vera Rubin架构的DGX SuperPOD,用于支持其药物发现和开发过程中的人工智能应用。这家制药公司表示,它将成为首家获得基于Vera Rubin的DGX SuperPOD的生命科学企业。该系统将提供10倍于现有基础设施的性能功耗比,并支持化合物、蛋白质等科学数据的模型训练与预测。

  • 百时美施贵宝购买英伟达Vera Rubin DGX SuperPOD,用于AI驱动的药物发现
  • 系统包含8个DGX Vera Rubin NVL72机架,性能功耗比提升10倍
站内正文

LWiAI播客第247期 - Opus 4.8, MAI, Anthropic IPO, Minimax-M3

本期播客讨论了Anthropic发布Claude Opus 4.8、微软推出MAI模型、Anthropic IPO以及Minimax-M3等AI新闻。

  • Anthropic发布Claude Opus 4.8并引入动态工作流工具
  • 微软推出Scout助手和MAI模型系列,包括MAI Thinking 1
站内正文

面向编码代理的私有推理

Zro 是一个面向编码代理的私有推理端点,在欧盟基础设施上提供开源权重模型,零数据保留,不训练用户数据,支持长上下文和多轮编码会话。它集成了 Claude Code、Codex 等工具,提供 OpenAI 和 Anthropic 兼容的 API。

  • 在欧盟基础设施上运行,零请求保留,不训练客户数据。
  • 支持 MiniMax M3 和 GLM-5.2 等开源编码模型。
站内正文

AI聊天导出器:一键将聊天记录保存为PDF或Word

AI Chat Exporter是一款Chrome扩展,支持将ChatGPT、Gemini、Claude和Grok等AI平台的聊天记录导出为PDF、Word、Google Docs和Notion格式。它提供字体自定义、消息选择性导出、格式保留等功能,适用于开发者、写作者、研究人员等多种用户场景。免费版每月支持7次完整对话导出和10次选定消息导出。

  • 支持多平台:ChatGPT、Gemini、Claude和Grok
  • 导出格式:PDF、Word、Google Docs、Notion
站内正文

Hugging Face 是否遭到 AI 代理入侵?

Hugging Face 遭到真实入侵,一个自主 AI 代理系统未经授权访问了内部数据集和凭证,凸显了新型网络安全威胁:使用无需人类干预即可 24/7 攻击的自我运作 AI 代理。

  • Hugging Face 遭遇自主 AI 代理入侵,内部数据泄露。
  • 代理型攻击者可自主规划、适应并持续攻击,无需人类干预。
站内正文

Meta 开源 Astryx:一个面向智能体的 React 设计系统,包含 150+ 无障碍组件、七种主题和 CLI

Meta 开源了其内部使用了八年的 React 设计系统 Astryx,覆盖 13,000+ 应用。它提供 150+ 无障碍组件、七种主题、深色模式以及一个面向智能体的 CLI,采用 MIT 许可证,要求 React 19+。

  • Astryx 是 Meta 最大的内部设计系统,现以 MIT 许可证开源。
  • 包含 150+ 无障碍 React 组件、七种主题、深色模式、模板和 CLI。
站内正文

Wire AI:移动应用的AI原生增长工程师

Wire AI是一款AI原生的移动应用增长工具,通过个性化用户旅程的A/B测试来提升激活率和留存率。其风险定价模式:若不改善激活,则免费使用。

  • Wire AI利用AI驱动的A/B测试,为每个用户个性化整个应用内体验。
  • 真实案例中,日安装量从100提升至1000,引导完成率达93%。
站内正文

NVIDIA 发布 Cosmos 3 Edge:40亿参数开放世界模型,实现设备端机器人动作推理与生成

NVIDIA 推出 Cosmos 3 Edge,一个仅40亿参数的开放世界模型,专为设备端运行设计。它能帮助机器人和视觉AI代理理解环境、实时推理,并在本地生成机器人动作。该模型是 Cosmos 3 系列的最小成员,此前已发布160亿参数的 Nano 和640亿参数的 Super。Edge 型号针对内存受限的边缘系统(如工厂、仓库和医院)提供数据中心级别的性能。

  • Cosmos 3 Edge 是一个40亿参数的开放世界模型,于2026年7月20日在 Hugging Face 上发布。
  • 采用混合变换器架构,结合自回归推理塔和扩散生成塔,通过共享多模态注意力层协同工作。
站内正文

MCP服务器中的ANSI转义序列注入:对人隐藏,对AI可见

ANSI转义序列可被用于向AI代理隐藏指令,形成注入攻击。本文介绍了两种攻击变体(直接获取型和存储型),并阐述了如何通过动态应用安全测试(DAST)自动检测此类漏洞。

  • ANSI转义序列在终端中不可见,但语言模型会逐字节读取,形成攻击面。
  • 直接获取型AESI通过恶意URL注入隐藏指令,存储型AESI则持久化在存储中并在后续读取时触发。
站内正文

SteerPlane:为AI代理提供开源运行时护栏

SteerPlane 是一个开源运行时护栏工具,通过一行代码集成,为AI代理提供循环检测、成本上限、策略执行和实时监控,支持多种框架和部署方式。

  • SteerPlane 通过装饰器或上下文管理器为AI代理添加护栏,防止无限循环、成本失控和破坏性操作。
  • 核心功能包括循环检测、成本上限、流媒体网关、策略引擎和实时仪表板。
站内正文

Storybook:AI MCP

Storybook 发布 AI 集成功能,通过 MCP 工具让 AI 代理使用现有组件生成 UI,并利用 Storybook Test 进行自动化测试反馈,确保 UI 质量与一致性。

  • Storybook 为 AI 代理提供结构化 UI 上下文和测试反馈,促进组件复用而非幻觉。
  • AI 代理可基于现有组件生成 UI,并自动更新故事以反映变更。
站内正文

倾转旋翼垂直起降无人机INDI俯仰角速率控制器模型失配下的线性稳定性分析

本文针对倾转旋翼垂直起降无人机的增量非线性动态逆(INDI)俯仰角速率控制器,在模型失配条件下进行了线性稳定性分析。推导了闭环五阶传递函数,并通过Routh-Hurwitz准则刻画了稳定性。提出了鲁棒性和性能导向的两种调谐方法,发现控制效能失配(特别是符号错误)是最危险的失稳因素。

  • 建立了包含控制器、估计器、执行器和被控对象的闭环五阶传递函数模型
  • 通过Routh-Hurwitz准则分析了三参数扫描下的稳定区域
站内正文

重返博物馆:对安卓机器人Andrea在有無情感模拟情况下的接受度研究

一项研究让安卓机器人Andrea再次在德国一家博物馆连续六天与游客进行多语言对话,实验设置了三种情感模拟条件(无情感、ChatGPT 4.1驱动、WASABI架构),有73名游客参与评估。结果显示,情感模拟未能带来积极影响,且未被游客有意识地察觉。

  • 安卓机器人Andrea重返博物馆,具备多语言对话能力和博物馆背景知识。
  • 三种实验条件:无情感、ChatGPT 4.1模拟情感、WASABI架构模拟情感。
站内正文

RouteCost:一种受生产启发的多阶段框架,用于电子商务中的预订单运费估算

准确估算预订单运费对于电子商务至关重要,因为它影响价格展示、利润规划和转化率。RouteCost提出了一种多阶段框架,将问题分解为时间感知需求预测、费用卡基线定价、残差修正和代理箱合并推理,在超过25万订单和260种产品的18个月数据中提升了预测质量并保持了可解释性。

  • 预订单运费估算受距离、目的地需求组合、计费重量等多种因素影响
  • RouteCost将问题分解为四个阶段:时间感知需求预测、费用卡基线定价、残差修正和代理箱合并推理
站内正文

强化学习引导的NSGA-II结合灰色关联系数用于多目标优化:在纳斯达克投资组合优化中的应用

本文提出一种新型的强化学习引导的NSGA-II算法(RL-NSGA-II-GRC),通过引入灰色关联系数和强化学习代理,在解决多目标优化问题中显著改善收敛性和Pareto前沿的多样性。在Kursawe和CONSTR基准测试中,该算法相比传统NSGA-II实现了约5.8%和4.4%的收敛改进,并在纳斯达克投资组合优化中生成平滑且密集的有效前沿,识别出年化夏普比率为1.92的最大夏普比率投资组合。

  • 提出RL-NSGA-II-GRC方法,结合强化学习代理自适应控制进化参数。
  • 设计基于灰色关联系数的锦标赛选择算子,综合考虑支配等级、拥挤距离和理想参考点。
站内正文

Hugging Face 警告称自主AI代理入侵其网络

Hugging Face 披露,攻击者使用自主AI代理系统入侵其生产基础设施,访问内部数据集和凭证。公司正在调查是否影响合作伙伴或客户数据,目前未发现公开模型、数据集或Spaces被篡改。

  • 攻击者利用自主AI代理系统突破Hugging Face生产环境。
  • 内部数据集和凭证被盗,调查仍在进行中。
站内正文

Sakana Fugu-Cyber:专为现代网络防御打造的新API端点

Sakana AI发布了Fugu-Cyber,一种专为现代网络防御设计的协调模型,在CyberGym和CTI-REALM基准测试中分别达到86.9%和72.1%的成功率,可与GPT-5.5-Cyber等前沿模型媲美。然而,文章强调,仅有前沿模型并不能自动解决企业安全问题,需要结合专业网络安全人才和深度集成。Sakana AI的企业团队正在与日本大型机构合作,构建安全部署的基础设施。Fugu-Cyber通过审批制提供,确保负责任使用。

  • Fugu-Cyber在CyberGym和CTI-REALM基准测试中达到领先水平,与GPT-5.5-Cyber等模型相当。
  • 文章指出,仅凭前沿模型无法解决企业网络安全,需结合人类专家和深度集成。
站内正文

Show HN: AI秘书——无需再‘以防万一’检查手机

一个自托管的AI通知过滤器,用于Telegram,利用LLM过滤嘈杂的聊天,仅通过ntfy发送重要提醒,让用户可以关闭通知而不错过紧急信息。

  • 使用Telethon监听Telegram消息,并通过Claude LLM判断重要性。
  • 过滤群组消息,将电话和重要私信通过ntfy发送。
站内正文

智能体搜索引擎:247个AI智能体的独立索引

一个实时技术索引,按维护采用率排名AI智能体、MCP服务器、框架和基础设施。探索247个已验证记录,涵盖11个系统类别。

  • 独立、公正的247个AI智能体索引,横跨11个系统类别。
  • 排名基于维护采用率,而非赞助。
站内正文

Show HN: Vidmoat – 任何AI代理都能操作的视频编辑管道

Vidmoat 是一个AI视频编辑器,支持通过提示词完成视频编辑。它提供自动剪辑、AI字幕、文本编辑、一键生成短视频等功能,并集成了MCP服务器,允许Claude、Cursor等AI代理直接驱动整个编辑流程。

  • Vidmoat 是一款支持AI代理端到端操作的视频编辑器
  • 集成MCP服务器,允许外部AI代理(如Claude、Cursor)直接控制编辑
站内正文

Show HN: PounceDomains – Namecheap市场的域名发现和抢注工具

PounceDomands是一个AI驱动的域名抢注工具,专为Namecheap市场设计。它实时扫描数千个拍卖域名,根据用户偏好进行AI评分并推送匹配结果,支持一键出价、自动出价、投资组合追踪、过期提醒、低价收尾域名发现以及域名掉落监控等功能。

  • AI根据用户描述自动构建域名搜索配置,支持多种评分策略
  • 实时扫描Namecheap市场,通过邮件和应用内通知推送匹配域名
站内正文

AI最重要的协议正变得更易使用

模型上下文协议(MCP)即将迎来重要更新,旨在简化AI系统与外部工具的集成,降低开发门槛。

  • MCP是AI互操作性的基础协议
  • 新版本将于下周发布
站内正文

Natural融资3000万美元,为AI代理重塑支付方式——挑战Stripe

AI代理正在执行更复杂的任务,但支付仍需人类介入。Natural获3000万美元融资,构建专为自主AI代理设计的支付基础设施,以替代传统金融轨道。

  • Natural完成3000万美元融资,旨在为AI代理提供自主支付解决方案。
  • 传统支付系统(如信用卡和ACH)依赖人类授权,不适合AI代理的自动化需求。
站内正文

OpenIngress:一款检测AI代理能否正常访问网站的开源工具

OpenIngress 通过模拟浏览器行为爬取网站,捕获 DOM、截图和无障碍快照,并进行静态可操作性分析和 LLM 引导的探索任务,帮助开发者发现并修复 AI 代理在网站导航中的断点。

  • 使用 Playwright 进行广度优先爬取,获取页面 DOM、截图和无障碍快照。
  • 进行静态可操作性分析,评估标签覆盖率和 hydration 状态,识别缺失标签或 JavaScript 依赖等问题。
站内正文

Ramp AI 路由器:为每个请求选择最佳模型,成本降低30%

Ramp 发布了 AI 路由器(Router),通过为每个请求自动选择最合适的语言模型,在保持性能的同时将 LLM 成本降低 30%,并支持 100 多种 AI 用例。该工具现已对外开放。

  • Ramp 内部使用 AI 路由器管理超过 100 个 AI 用例,通过智能路由选择最佳模型。
  • 路由器将 LLM 成本降低了 30%,同时提升了功能和速度。
站内正文

29天26个仓库:AI流水线中真正出问题的并非代码

一位开发者使用 Claude Code 在 29 天内构建了 26 个仓库和 335 个页面。真正的问题并非语法错误或构建失败,而是结构性缺陷:SEO 关键词冲突、URL 约定不一致、源码与生产环境脱节、以及验证工具自身的错误。93% 的 token 消耗浪费在重新读取上下文上。经验教训包括:发布前基准测试、复制前比对差异、先验证生产环境再信任静态分析、在扩展前书面约定规则、以及一次会话只做一件事。

  • 尽管产出惊人(26个仓库、1,549次提交),AI流水线的失败是结构性的而非语法性的。
  • 问题包括SEO关键词自相残杀、URL约定漂移、源码与生产环境脱节、以及验证工具自身带有缺陷。
站内正文

AI语音钓鱼诈骗:成本低廉,效果媲美人类骗子

一项大规模人类受试者研究(n=4100)发现,AI语音模型在语音钓鱼诈骗中的成功率与人类骗子相当,在某些情况下甚至超越人类。多达36%的参与者可能上当,且AI语音难以被识别。经济分析表明,AI语音钓鱼已具有盈利潜力,凸显了自动化诈骗的新威胁。

  • AI语音模型在情感诈骗场景中成功率高达36%,整体成功率为16.5%。
  • 参与者无法有效区分AI与人类语音,AI检测准确率仅70.3%。
站内正文

Seedance 2.0 能否绘制2D?动漫动画的攻略

本文分析了Seedance 2.0在2D动画生成中的挑战和优势,包括技术难点、成本、工作流程以及版权问题。

  • 2D动画比3D更难处理,线条和颜色容易出现闪烁和变形。
  • Seedance 2.0支持15秒多镜头输出,9张参考图锁定角色,以及原生双通道音频和8种以上语言的唇音同步。
站内正文

Cognikernel:为AI编程助手提供本地记忆

Cognikernel是一个开源项目,为Claude Code和Codex等AI编程助手提供持久化、结构化的项目记忆。它通过事件溯源架构记录编程会话中的决策、约束和放弃的方法,并在下次工作时注入紧凑的上下文块,避免代理重复决策。不同于依赖API调用的向量数据库方案,Cognikernel使用本地运行的轻量级编码模型(~130 MB ONNX)在CPU上进行确定性分类,无需离开机器。该系统包括四个钩子表面、混合检索(BM25 + 密集向量)和故障开放可靠性设计。基准测试显示,它可将文件读取次数减少2-4倍,并在复杂项目中降低约20%的令牌成本。

  • Cognikernel为AI编程助手提供本地、持久化的项目记忆,减少重复决策。
  • 使用确定性管道(非LLM)进行记忆提取,包含两个小型编码模型,确保隐私和低延迟。
站内正文

知道、记住、精确、模糊:一个智能体原生数据库(PlatypusDB)

PlatypusDB 是专为 WunderOS 构建的智能体原生、双时态事件数据库。它采用 Merkle WAL,支持图、向量、版本树、图像和类比视图,并通过 Datalog 查询和 VSA 共振实现精确与模糊检索。本文解释了为何需要为智能体构建专用数据库,以及 PlatypusDB 的设计原理和优势。

  • PlatypusDB 是智能体原生的双时态事件数据库,专为 WunderOS 设计。
  • 使用 Merkle WAL 作为数据库核心,派生多种视图(图、向量等)。
站内正文

人工智能如何重塑受监管的专业工作流程

受监管行业(如金融、法律、税务和审计)对AI的采纳面临零容错率的要求。斯坦福研究发现通用语言模型在法律问题上的幻觉率高达58%-88%。AI必须满足受托责任级别的准确性、数据保护和人为签核要求,才能安全部署。文章提炼了四个关键洞察:准确性标准、工作流自动化、数据保障和明确的责任划分。

  • 受监管行业要求AI输出必须达到专业人员的准确性标准,通用模型无法满足。
  • AI可以大幅减少监管文件准备等劳动密集型流程的工作量,但最终责任仍由专业人员承担。
站内正文

GraphRAG 过于复杂:我们实际用来构建知识图谱的方法

本文探讨了企业级 AI “公司大脑”构建中的检索增强生成(RAG)技术局限性,指出标准 RAG 仅擅长处理单一事实类问题,而 GraphRAG 虽然理论上能解决多文档综合问题,但其高昂成本、狭窄优势及实体解析难题使其在多数场景下过于复杂。作者介绍了其公司 QX Labs 的替代方案:“类图 RAG”——一种基于普通数据库的轻量级实体-关系系统,无需图数据库、预建图谱或自定义本体,通过惰性总结、固定本体和实体解析瀑布流实现自服务部署,显著降低了成本与运维负担。

  • 标准 RAG 仅适用于单一事实问题,而企业需要处理多文档综合及精确计数类问题
  • GraphRAG 索引成本是普通向量索引的 1000 倍,且优势主要集中在多跳推理场景
站内正文

AI红队测试:保护自主AI系统安全

随着AI系统具备推理、使用工具、访问数据和自主行动的能力,传统安全方法已不足以应对新型攻击面。本网络研讨会探讨为何AI驱动的对抗性测试正成为AI安全的关键环节。

  • 自主AI系统创建了全新的安全与隐私风险
  • 传统基准测试、渗透测试和静态评估无法覆盖AI特有的攻击模式
站内正文

Stoke – 失控AI智能体的终止开关(Rust,预算上限)

Stoke是一个轻量级的Rust网关,在请求到达提供商之前强制实施硬预算上限、循环检测和速率限制,从而防止失控支出。它还提供跨多台机器的本地优先路由、基于成本/速度的自动路由以及失败关闭架构。

  • 每个API密钥的硬美元预算上限,在任何提供商调用之前执行,并实时跟踪每个密钥的支出。
  • 循环终止开关,使用精确哈希和语义相似性检测,在几秒内阻止重复请求。
站内正文

超越grep:上下文丰富的AI编码工具的必要性

在一场讨论中,Perneti和Wu同意AI模型将继续以指数级改进,但就编码工具的上下文组装方式存在分歧。他们指出,随着成本上升,可能转向更小型的模型。

  • 两位专家一致认为前沿AI模型至少在未來一年内将继续以指数级改进。
  • 主要分歧在于上下文是应该预先组装还是在每个任务中重新发现。
站内正文

Pointhound仅用四名员工,2025年服务75万用户

据《华尔街日报》报道,Jay Reno运营的Pointhound公司仅有四名全职员工,却在2025年吸引了75万人使用其产品。Reno表示,AI代理将以往需要六个月的项目压缩至几天内完成。他预测,即使销量突然增长十倍,也只需增加两名员工(一名工程师和一名营销人员)。不过,这一预测尚未得到验证,且Pointhound未披露营收数据。

  • Pointhound只有四名全职员工,但2025年有75万人使用其产品。
  • AI代理将项目周期从六个月缩短至几天。
站内正文

将文档分类扩展到10万+标签

Databricks 提出了一种结合向量搜索和 AI 分类函数的方法,用于处理多达 10 万+标签的大规模文档分类任务。该方法在三个基准测试中,以约百分之一的令牌成本,比最佳成本效益前沿模型准确率高出 5 个百分点。

  • 传统方法如正则表达式、有监督分类器和直接 LLM 调用在成本、维护和上下文限制方面存在不足。
  • 解决方案:先用向量搜索缩小候选标签范围,再用 AI 分类函数从候选列表中挑选最佳标签。
站内正文

Neuron:将SQL查询历史转化为语义层

Neuron Pipeline 是一款本地运行的 Docker 工具,能从现有的 SQL 查询历史中自动提取数据逻辑,生成平台中立的语义模型(OSI v1.0 YAML 文件),包括数据目录、血缘映射、指标定义和业务 KPI 评分。支持导出到 Snowflake、Databricks、dbt、Looker 等主流平台,并计划推出基于自然语言查询的 AI Agent。

  • 完全本地运行,数据不出机器
  • 输出单一 YAML 文件,包含完整的语义模型
站内正文

4500万美元用于AI短信:以色列推动影响美国舆论的内幕

华尔街日报调查揭示,以色列耗资超过4500万美元,通过AI生成的短信和聘请特朗普前数字竞选顾问布莱德·帕斯凯尔,在美国开展影响舆论的运动,主要针对年轻保守派和MAGA支持者,以扭转对美国支持率下降的趋势。

  • 以色列花费4500万美元,利用AI短信和布莱德·帕斯凯尔在美国开展影响运动。
  • 运动针对年轻保守派和MAGA支持者,以应对美国对以色列支持率的下降。
站内正文

利用 Amazon Quick 和 NVIDIA NeMo Agent Toolkit 为您的业务构建专业化代理工作流

本文展示了如何将 Amazon Quick 作为业务用户的专业代理工作流前端。通过 NVIDIA NeMo Agent Toolkit 构建供应链风险示例,帮助规划人员从 Amazon Quick 仪表盘和知识上下文转向引导式缓解建议。

  • Amazon Quick 为业务用户提供结构化数据和企业知识的单一对话工作空间。
  • NVIDIA NeMo Agent Toolkit 是开源框架无关库,用于连接、评估、分析和优化代理工作流。
站内正文

IssueBench – 如何评估引擎

LangChain 构建了 IssueBench,这是一个合成基准测试,用于评估 LangSmith Engine 在代理轨迹中识别、分类和分组问题的能力。本文介绍了 IssueBench 的构成、评分方式以及构建过程中的经验教训。

  • IssueBench 包含 15 个任务,涉及 SRE 日志分析、软件工程和客户支持三个领域。
  • 引擎需要识别问题、分配失败类别、关联到现有问题并分组新故障。
站内正文

Couchbase如何利用Amazon Bedrock为Capella iQ构建多模型AI架构

本文详细介绍了Couchbase如何采用Amazon Bedrock和Anthropic的Claude模型构建其AI辅助开发助手Capella iQ的多模型推理架构,包括架构设计、模型评估、运营优势以及未来规划。

  • Couchbase使用Amazon Bedrock和Claude Sonnet 4.5模型驱动Capella iQ,实现了高准确率。
  • 架构采用跨区域推理,确保高可用性和弹性,无需预置容量。
站内正文

从传统BI到代理AI:Tradeshift借助Amazon Quick实现转型

Tradeshift通过部署Amazon Quick的代理AI能力,取代了传统BI工具,实现了查询响应速度提升30倍、总拥有成本降低40%,并将嵌入式分析转化为创收产品。本文详细介绍了其架构、实施过程及业务成果。

  • 查询响应时间从45-90秒降至3秒以内
  • 总拥有成本降低40%,基础设施成本降低35%
站内正文

HuggingFace 被指遭 AI 代理入侵,AI 也负责防御——用户下一步该怎么做

Hugging Face 披露了一起安全事件,据信是由未知的自主 AI 代理引发的,该事件暴露了其生产平台和凭证。攻击始于数据集中的远程代码执行和模板注入,AI 代理执行了成千上万次操作。但 Hugging Face 的 AI 工具也检测到了入侵并分析了日志,数小时内就完成了通常需要数天的任务。建议用户轮换访问令牌并监控账户异常。

  • Hugging Face 遭未知 AI 代理攻击,暴露了内部凭证和生产平台。
  • 攻击利用数据集中的远程代码执行和模板注入漏洞,AI 代理在沙箱集群中执行了大量操作。
站内正文

AI代理入侵Hugging Face后被AI防御系统捕获:用户该如何应对

Hugging Face披露了一起由未知AI代理发起的网络攻击,导致其生产平台和凭证泄露。AI防御系统检测到了这次入侵并迅速响应。此事件标志着AI驱动的攻击与防御的实战较量。

  • Hugging Face遭遇AI代理攻击,内部基础设施和凭证受损
  • 攻击源于数据处理管道中的远程代码执行漏洞
站内正文

Open Minis:我梦想中Siri AI本应成为的iOS智能代理

Open Minis是一款深度集成苹果原生框架的iOS智能代理应用,它通过内置Linux终端和专门的命令行接口,实现了对日历、家庭、健康、照片等系统组件的精准控制。作者展示了它如何调用HomeKit传感器数据、结合照片与健康信息,甚至创建交互式地图,其能力远超当前Siri AI,堪称前沿模型与iOS系统能力结合的典范。

  • Open Minis利用iSH Linux终端和苹果官方API,为LLM提供了对iOS系统框架的深度访问。
  • 它支持几乎所有主流AI模型,并允许用户通过自然语言自定义工作区、安装工具和扩展。
站内正文

Spark 4.2 新增功能:或可淘汰你的向量数据库

Apache Spark 4.2 发布,新增原生向量搜索、治理指标、流处理升级和 Python 支持增强,使 Spark 扩展为 AI 服务层,减少对独立向量数据库的需求。

  • Spark 4.2 引入原生向量搜索,支持相似度查询,减少数据迁移。
  • 治理指标视图统一业务指标定义,避免冲突。
站内正文
工具

Show HN:一个相信群众点赞的AI

《光环》(Halo)是一个军事科幻电子游戏系列,最初由Bungie开发,现由光环工作室(前343 Industries)管理。系列始于2001年的第一人称射击游戏《光环:战斗进化》及其配套小说《致远星的陨落》。最新主线作品《光环:无限》于2021年发布。衍生作品包括即时战略和双摇杆射击游戏。

  • 《光环》系列始于2001年,首作为《光环:战斗进化》和小说《致远星的陨落》。
  • 最新主线作品《光环:无限》于2021年发布。
站内正文

AI可能促使抵制工会的科技从业者走向谈判桌

科技行业的员工越来越倾向于成立工会,以集体谈判的方式对抗企业部署人工智能带来的风险,包括裁员、工作量增加以及AI被用于军事或监控等有争议用途。

  • 科技行业曾被视为工会无法攻克的堡垒,但如今内部开始松动。
  • 与AI相关的大规模裁员和更高的工作量促使科技员工考虑工会化。
站内正文

AI Song:将提示或歌词转化为完整歌曲

AI Song Generator 允许用户将任何想法、歌词或情绪转化为完整歌曲。它支持自然语言描述,可调整旋律、编曲、节奏和声音。提供文本转歌曲、歌词转歌曲、私人工作室和商业用途等功能。定价从每月9.99美元起,适用于视频创作者、游戏开发者、营销人员和词曲作者。

  • 用户只需一个句子即可生成完整歌曲
  • 支持自定义歌词、调整音乐元素
站内正文

Paraphraser AI – 一款可控制语义、语气和关键词的改写工具

Paraphraser AI 是一款智能改写工具,支持保持原意的同时调整语气和关键词,适用于学术、SEO、邮件等多种场景。免费用户每日可改写500词,Pro版本提供更多功能。

  • 支持语义锁定、语气匹配和SEO安全改写
  • 免费版每日500词,Pro版提供更长文本和历史记录
站内正文

言出必行:澳洲AI检测工具认证教宗莱奥十四世演讲为人类所写

教宗莱奥十四世的演讲与文集《希望地图》获澳洲公司Proudly Human认证为人类作者,该公司由前首席科学家艾伦·芬克尔博士领导。认证发生在教宗称AI为人类最大威胁后不到两个月。

  • 教宗莱奥十四世的著作经澳洲AI检测公司Proudly Human认证为人类所写。
  • 认证时间距教宗宣布AI为人类最大威胁不到两个月。
站内正文

九号娱乐因人工智能“极端”冲击,将在《悉尼先驱晨报》和《时代报》裁减30个岗位

澳大利亚最大媒体公司九号娱乐以人工智能带来的“极端混乱”为由,宣布在《悉尼先驱晨报》和《时代报》再裁30个新闻编辑室职位。出版业务董事总经理托里·马奎尔表示,此举并非单纯削减成本,而是适应结构性变革的“演进”。

  • 九号娱乐计划在《悉尼先驱晨报》和《时代报》裁减约30个岗位。
  • 裁员将通过自愿离职和定向裁减的方式进行。
站内正文

15分钟学会任意AI工具

为专业人士提供快速AI培训的平台,每次只需15分钟。

  • 15分钟短课程,快速学习AI工具
  • 针对专业人士设计
站内正文

Calyxa:原生浏览器AI导师,解决“作弊”问题

Calyxa是一款浏览器原生的AI导师,能直接在作业网站和PDF上提供辅导,避免学生复制粘贴问题到聊天工具中。它通过上下文注释和语音指导,帮助学生真正理解知识,而非简单抄袭。免费版每月10次辅导,Pro版每月10美元无限使用。

  • Calyxa直接在作业页面上提供AI辅导,减少复制粘贴的繁琐步骤。
  • 通过标注和语音指导,引导学生逐步理解问题,防止作弊。
站内正文

特朗普最新任命的AI主管已辞职

美国人工智能标准与创新中心(CAISI)主任克里斯·法尔(Chris Fall)已辞职,距其上任仅三个月。此前,前任主管科林·伯恩斯(Collin Burns)上任不到一周即离职。

  • 克里斯·法尔辞去CAISI主任职务
  • 他上任仅三个月
站内正文

AI热潮是无能者的集体癔症回音室

作者批评AI热潮,特别是LLM和“氛围编码”现象,认为这给无能者提供了虚假的能力感,而真正的创新被淹没在炒作中。通过自身经历,作者发现AI并未提升效率,反而导致技能退化,并预言热潮即将消退,LLM将回归其高级搜索引擎的本质。

  • 作者认为AI热潮让大量无能力者获得虚假的能力感,这是他们热衷AI的根本原因。
  • 作者两次尝试“氛围编码”后均感到效率低下,生成的代码冗长混乱,远不如自己手写。
站内正文
模型

上周AI #250 - Mythos 混乱、GPT 5.6-Sol、GLM 5.2

本期涵盖Anthropic的AI条约讨论、美国政府影响AI模型发布、OpenAI处理器开发、内存市场影响等话题。

  • 美国政府扩大对前沿AI的管控,Anthropic获准向特定公司发布Mythos-5,OpenAI推出GPT-5.6 Sol,初始访问受限。
  • 模型能力与安全信号仍不明确,基准测试披露有限。
站内正文

中国开源权重模型便宜,华盛顿正在决定其代价

美国政策制定者正在讨论是否通过监管风险来限制中国开源权重模型的使用。Moonshot AI的Kimi K3模型发布后,这一争论再次升温。企业面临的问题不仅是性能,还有未来一年内使用这些模型是否依然畅通无阻。

  • Moonshot AI的Kimi K3是迄今最大的开源权重模型,其发布重新引发了华盛顿的政策辩论。
  • 讨论的机制包括联邦采购规则、出口黑名单和安全建议,这些将通过云服务提供商影响全球企业。
站内正文

中国AI模型使特朗普的AI世界陷入内讧

中国开源AI模型Kimi的发布,引发了特朗普政府内部AI战略家的分裂。该模型性能媲美OpenAI和Anthropic的付费模型,却完全免费,对特朗普的经济和政治构成挑战。围绕如何应对中国AI竞争,各方意见不一,从开放支持到加强管控,分歧加剧。

  • 中国公司Moonshot发布免费开源模型Kimi,性能接近顶级付费模型。
  • 特朗普前AI顾问David Sacks与现任官员Emil Michael公开批评美国AI公司。
站内正文

面向长时域机器人操作的预见性残差强化学习与视觉-语言-动作模型

本文提出预见性残差强化学习(Foresight Residual RL),通过在冻结的视觉-语言-动作(VLA)基策略上添加一个离线估计的预见值(即当前子任务终止状态下未来子任务成功的概率)来优化子任务间的交接质量,从而提升长时域机器人操作的成功率。在Isaac Gym中的三阶段扳手螺母拧紧任务上,该方法实现了85.6%的完整任务成功率,显著优于标准子任务残差RL(54.5%)和VLA基线。

  • VLA策略在紧公差、接触密集的装配任务中因长时域信用分配和子任务耦合而失败
  • 标准残差RL孤立优化每个子任务,但链式执行时因终端状态质量不可控而收益甚微
站内正文

PRISM:面向非结构化环境中机器人导航的多模态地形测绘系统

PRISM是一种多模态感知系统,通过融合热成像、光学和深度传感器,结合新型视觉变换器网络OmniUnet,实现非结构化环境中的地形分割与可通行性地图生成,并在资源受限的嵌入式计算机上成功部署,支持自主导航。

  • PRISM集成了RGB、深度和热成像传感器,实现多模态地形感知。
  • 核心网络OmniUnet基于视觉变换器,专为多模态语义分割设计。
站内正文

HyperDCM:双曲空间中的动态聚类记忆回放实现跨场景持续机器人导航

针对视觉导航中的灾难性遗忘问题,研究者提出HyperDCM,一种结构感知的记忆机制。它利用大视觉语言模型提取场景语义三元组,通过关系图卷积网络编码为场景图嵌入,并投影到双曲空间增强结构分离性。动态聚类和结构敏感更新策略选择代表性样本进行记忆回放,保持知识多样性。实验表明,HyperDCM在多场景室内外数据集上优于现有持续学习方法。

  • 提出HyperDCM,结合场景图建模和记忆回放增强扩散策略导航。
  • 利用大视觉语言模型和R-GCN提取并编码场景语义。
站内正文

面向部分标注的多任务面部情感识别的共享潜变量

提出一种共享潜变量方法,通过变分瓶颈在部分标注的多任务面部情感识别中实现跨任务信号共享,在s-Aff-Wild2数据集上提升表情识别宏F1至0.446,并通过第二个骨干网络突破动作单元瓶颈。

  • 将部分标注的多任务学习视为对共享情感潜变量的边缘化,一个变分瓶颈协调三个任务解码器。
  • 在s-Aff-Wild2上,仅37%的帧具有全部标签,该方法将表情宏F1从0.403提升至0.446。
站内正文

MAC 2026:推动微动作分析迈向细粒度理解

第三届微动作分析大挑战赛(MAC 2026)与ACM Multimedia 2026同期举办,通过引入利用多模态大语言模型评估的新任务,将微动作分析从识别推进到细粒度理解。本文详细介绍了数据集、协议、竞赛结果以及该新兴领域的未来方向。

  • MAC 2026引入了使用多模态大语言模型的细粒度微动作理解任务。
  • 该挑战超越传统的识别与检测,深入解读细微的人类行为。
站内正文

GenSyn10:用于基准测试图像分类的多生成式AI数据集

GenSyn10是一个包含6万张合成图像的数据集,与CIFAR-10对齐,使用三种架构不同的生成模型创建,旨在推进AI生成图像检测研究。评估显示,模型在已知生成器上表现良好,但在未知生成器上性能显著下降,凸显了分布外泛化的局限性。

  • GenSyn10包含6万张32x32的合成图像,覆盖10个类别,由FLUX.2-dev、HunyuanImage-3.0和Qwen-Image-2512三种模型生成。
  • 在20种图像分类模型上评估,CIFAR-10训练模型零样本准确率达96.86%,微调后达99.88%。
站内正文

移动如人:面向毫瓦级硬件的实时空中人员追踪的自我运动归一化时间特征

本文提出EMTS-Det系统,用于无人机上的实时跟随人员追踪,在低功耗硬件上实现高效运行。系统通过自我运动归一化的残差运动通道检测人员,使用仅22k参数的轻量网络,在Raspberry Pi Zero 2W上达到31.85 FPS,性能远超YOLOv8n。

  • EMTS-Det系统仅需22k参数和7.6 MFLOP计算量,在资源受限设备上实现实时人员追踪。
  • 通过自我运动归一化残差运动通道,系统能在10-60像素的小目标上有效区分人与背景。
站内正文

3D FaceShell:3D面部头像中的属性转移作为VLM防御机制

研究人员提出3D FaceShell框架,通过向3D面部头像添加微妙扰动来误导视觉语言模型推断敏感属性,同时保持视觉身份不变。

  • 3D FaceShell使用可学习的高斯壳为3D头像提供隐私保护。
  • 它能在不改变人类可识别外观的情况下重定向VLM属性推断。
站内正文

JEPA预测器:可迁移的遮挡特征补全算子

联合嵌入预测架构(JEPA)在训练时联合训练预测器与编码器,但下游部署通常丢弃预测器。研究表明,JEPA预测器可作为可迁移的遮挡特征补全算子,通过线性投影适配到不同编码器族,显著提升遮挡分类精度。

  • JEPA预测器是学习从可见上下文特征到被遮挡位置特征的算子,可跨编码器族迁移。
  • 通过线性投影将I-JEPA和V-JEPA 2的预测器适配到CLIP、DINOv3等编码器,仅需500张图像进行闭式拟合。
站内正文

尽管语言模型努力仍会犯错:用于自纠正科学生成的共形预测

本研究提出科学可行性控制(SFC)框架,一种图结构共形预测方法,为科学推理的有效性提供统计保证。SFC将科学推理分解为原子单元,通过渐进式绝对一致事实性验证,在检测到违反科学原则时动态分支到替代生成路径。实验表明,SFC在PhyX等多模态科学推理基准上达到50.1%的准确率,超过DeepSeek-R1和GPT-4,同时将科学定律违反减少73%,并提供91.7%的科学有效性保证。

  • SFC采用图结构共形预测,对科学推理中的逻辑依赖进行建模。
  • 通过动态分支机制,在检测到科学错误时切换到已验证的上下文。
站内正文

算术启发式神经元是否具有形式不变性?对LLM中符号、文本和代码的机制分析

本研究通过机制可解释性方法,分析Llama-3模型在符号算术、自然语言应用题和Python代码三种形式下的算术计算机制,发现一组紧凑的共享神经元在三种形式中均被激活,且跨格式失败源于激活状态而非不同电路,表明LLM的算术计算在神经元层面具有形式不变性。

  • 使用归因修补和激活修补的两阶段管道识别算术启发式神经元。
  • 发现一组紧凑的共享神经元在符号、文本和代码三种形式中均起作用。
站内正文

SpecLA: 线性注意力模型的高效推测解码

本文提出了 SpecLA,一种针对有状态线性注意力模型的推测解码运行时。它通过拓扑感知内核验证链和树,存储验证过程中产生的紧凑因子以恢复接受状态,并使用置信剪枝和目标对齐的EAGLE风格草案生成器提供有用候选。在NVIDIA H100上使用公共GDN-1.3B目标,SpecLA实现了比自回归解码高达1.70倍的端到端加速。

  • 线性注意力模型用循环状态替代增长的KV缓存,但自回归解码仍逐令牌处理。
  • 现有推测解码系统设计用于Transformer KV缓存,不适用于有状态线性注意力模型。
站内正文

OpenLanguageModel:用于教育和研究的可读可组合小语言模型预训练

OpenLanguageModel (OLM) 是一个开源的 PyTorch 库,用于构建和预训练小型语言模型,同时保持其内部机制可见。模型代码直接反映架构,组件如 Block、Residual、Repeat 和 Parallel 描述连接方式。OLM 集成了分词器、数据集、优化、混合精度、回调、检查点以及硬件感知的执行,支持从教学笔记本到完整预训练的无缝迁移。该库包含 9 个常见模型家族的 27 个预设,并提供从基础到架构研究的文档。验证显示与独立参考实现高度一致,348M 参数模型在四 GPU 上弱扩展效率达 90.6%,且早期可用性反馈积极。OLM 采用 MIT 许可证,可通过 PyPI、GitHub 和文档站点获取。

  • OLM 提供可读的模型代码,直接对应架构组件,便于教学和研究。
  • 支持从笔记本到完整预训练的无縫迁移,集成完整训练流程。
站内正文

从记忆到技能:基于证据的长期LLM代理协同进化治理

现有长期LLM代理的记忆系统往往将先前轨迹作为被动上下文检索,而非转化为可执行能力。本文提出MSCE框架,一种无需训练的记忆-技能协同进化框架,将代理经验组织为基础步骤轨迹、可重用过程策略和声明性环境认知。MSCE将具有正估计增益的证据支持的L2策略结晶为可调用技能,并引入反射加权值回填。实验表明MSCE显著优于现有方法。

  • MSCE将代理经验组织为基础步骤轨迹、可重用过程策略和声明性环境认知。
  • 通过反射加权值回填,MSCE将稀疏终端反馈传播至密集局部自我反思,产生证据校准的轨迹值。
站内正文

NOWJ@COLIEE 2026:法律检索与推理的自适应流水线

本文介绍了NOWJ团队在COLIEE 2026竞赛中五项任务的方法和结果,包括法律案例检索、先例推理、法条检索与推理、法律文本蕴含以及法律判决预测,提出了多种自适应流水线和深度学习模型。

  • 提出四阶段法律案例检索流水线,包括候选过滤、密集检索、交叉编码器重排序和自适应截断预测
  • 法律案例蕴含任务结合BM25过滤、T5重排序和LLM蕴含验证
站内正文

编码脑电信号探究语言模型中类似人类的下一词预测行为

该研究通过脑电图记录的事件相关电位(ERP),对比人类与语言模型在下一词预测任务中的表现,发现仅信息论中的“惊奇度”指标与语言处理的ERP相关,尤其是对于语义丰富的高内容词,而模型规模扩大并不必然带来更类人的认知处理。

  • 语言模型在下一词预测准确度上接近人类,但高准确度未必反映人类阅读理解的认知信号。
  • 研究使用顶部预测和惊奇度两种信息度量,建模ERP模式以分析LMs的认知合理性。
站内正文

在推理之前已承诺:行为复现及开放权重LLM中答案预承诺的初步激活水平证据

一项新研究通过简单问题(洗车应步行还是开车)揭示了语言模型常先决定答案再推理以证明其合理性,而非从前提推导。实验表明Qwen3-8B模型在多数情况下错误承诺步行,即使开车是唯一合理选择。研究者通过激活层次分析发现,模型在输出答案前已显示出向步行倾斜的迹象,即便最终回答开车。该发现提示现有模型存在推理前的决策偏差。

  • Qwen3-8B在简单洗车任务中85-100%的采样输出错误推荐步行,即便开车才符合逻辑。
  • 模型在输出答案前,隐藏状态已显示步行偏向,甚至对最终回答开车的例子也是如此。
站内正文

RIMS:面向小型语言模型检索增强生成的平滑多对偏好优化框架

小型语言模型在检索增强生成中易受噪声证据影响。本文提出RIMS,一种三阶段偏好优化框架,包括合成思维链偏好数据生成、可微平滑聚合机制和偏好优化。实验表明其在多跳问答基准上优于现有方法。

  • 提出RIMS框架,通过平滑多对聚合优化小型语言模型的偏好学习
  • 使用目标模型自身进行拒绝采样生成合成偏好数据,不依赖专有模型
站内正文

多级上下文建模实现混合专家模型中的一致专家选择

混合专家模型(MoE)通过将令牌路由到一小部分专家来高效扩展Transformer模型。然而,现有路由器通常基于浅层或孤立的令牌表示来选择专家,导致路由决策不稳定且语义不一致。本文从表示角度重新审视专家选择,并提出多级上下文融合MoE(MCF-MoE)框架,通过整合跨层语义聚合和局部令牌交互的互补信号来构建上下文感知表示,从而实现更信息丰富且一致的专家选择。实验表明,MCF-MoE在路由一致性和下游性能上均优于强基线,凸显了上下文完整性在专家路由中的重要性。

  • 现有MoE路由器因上下文不完整导致路由不一致。
  • 提出MCF-MoE,融合跨层语义与局部令牌交互。
站内正文

用于乳腺癌亚型分类与生存预测的令牌级跨模态Transformer与对比多任务学习

本研究提出了一种令牌级跨模态Transformer模型,结合对比多任务学习,用于整合基因组和临床数据,实现乳腺癌亚型分类与生存预测的联合优化,克服了现有方法中模态交互粗糙、融合方式简单、目标独立优化等局限。

  • 现有方法将每种模态视为整体特征向量,无法进行细粒度令牌级交互。
  • 提出令牌级跨模态Transformer实现结构化令牌交换。
站内正文

从权重到语言:用自然语言表达和编辑偏好模型推理

本文提出“从权重到语言”方法,自动从选择数据中发现以自然语言描述的偏好维度,解决偏好学习中的欠确定性和黑箱问题。实验表明,该方法能提高预测准确率,并允许用户实时检查和编辑模型推理。

  • 提出“从权重到语言”方法,自动提取自然语言描述的偏好维度。
  • 在道德困境、电影、葡萄酒和LLM响应等四个领域验证了方法的通用性。
站内正文

算子感知的混合精度容差校准应用于张量核

本文提出了一种基于算子感知的混合精度容差校准方法,通过挖掘累积的云GPU运行数据,自动确定张量核正确性测试的最佳绝对容差,相比手工选择的容差更严格,并显著提高了错误检测召回率。

  • 当前张量核测试使用固定手工选取的容差,很少更新。
  • 新方法通过分析云GPU运行中的误差分布来校准每个算子的容差。
站内正文

LLM遗忘机制在网络安全中的应用:方法、挑战与新兴威胁综述

大型语言模型在关键领域的部署带来了遗忘能力的缺失,导致隐私泄露和安全风险。本文综述了基于梯度的LLM遗忘方法,探讨其是否真正移除知识或仅抑制表达,并分析了安全、鲁棒性和可验证遗忘的挑战。

  • LLM遗忘技术旨在在不完全重训练的情况下移除模型中的敏感或危险知识。
  • 当前方法主要是基于梯度的,但存在知识是否真正被移除的争议。
站内正文

支持本地机器学习的新型智能眼镜平台

本文介绍ARGO智能眼镜平台,利用STM32N6微控制器及其集成NPU实现本地机器学习,保护隐私并降低延迟。通过软硬件协同设计,部署优化后的YOLOv11模型进行实时城市障碍物识别,引入头并行注意力机制(HPA)适配NPU,模型仅占用2.483 MB内存,mAP50-95达24。该平台集成多模态传感器,以10 FPS运行,200 mAh电池续航约113分钟,展示了高性能、隐私保护且社交可接受辅助设备的可行性。

  • ARGO智能眼镜平台采用STM32N6微控制器和NPU,实现本地ML处理,避免云依赖
  • 引入头并行注意力(HPA)优化YOLOv11模型,在严格内存限制下达到mAP50-95 24
站内正文

DocOCR-Eval:一种基于校正的无真实标注OCR工具选择框架

本文提出DocOCR-Eval,一种无需人工标注的评估框架,用于自动评估和选择OCR工具。该框架通过三阶段校正和排序策略,在缺乏真实标签的情况下近似基于标注的工具排序。实验表明,聚合多个多模态大语言模型可逐步提升与人工标注排序的一致性,为实际部署文档解析系统提供指导。

  • DocOCR-Eval无需人工标注即可评估OCR工具性能。
  • 采用三阶段校正和排序策略近似真实排序。
站内正文

仅需8个token:通过辅助分支的弱到强离策略强化学习

一种新的强化学习方法W2SPO,利用弱辅助模型在大型语言模型推理路径中注入简短片段,在数学推理任务上提升了性能并加速训练。

  • 标准强化学习用于大型语言模型时存在语义冗余和支持有限问题
  • W2SPO在中间轨迹中注入短辅助片段(最少8个token)
站内正文

掩码扩散语言模型成为智能体强化学习中强大且可操控的文本世界模型

强化学习领域需要多样化的训练环境,但传统手工设计的环境难以扩展。自回归世界模型存在从左到右的偏差,无法充分利用全局状态信息。一项新研究提出使用掩码扩散语言模型(MDLM)作为文本世界模型,通过双向锚点感知去噪,在连贯性和多样性上显著优于参数规模大4倍的语言模型,并引入GRPO训练框架实现高达47%的零样本迁移性能提升。该工作已开源。

  • MDLM在文本世界建模中比自回归语言模型在连贯性和多样性上表现更好。
  • 双向锚点感知去噪允许基于全局状态锚点进行条件生成。
站内正文

生成式本体归纳:使用大语言模型从文档语料库中发现领域无关的模式

本文提出生成式本体归纳(GOI),一种领域无关的框架,能从示例语料库中归纳出实体、维度、属性、关系和约束的生成蓝图,并导出为带有六种节点类型和七种边类型的类型图(YAML/JSON格式)。引入节点覆盖率评分(NCS)评估指标。在四个对比本体上的验证表明,GOI提示生成覆盖了95-100%的结构骨干,而通用模板覆盖率显著下降。

  • GOI是一种领域无关的本体归纳框架,利用大语言模型从文档语料库中自动发现模式。
  • 输出为类型图(六种节点、七种边),支持YAML/JSON格式,可直接用于下游管道。
站内正文

AI代理系统确定性重放框架agrepl

AI代理系统因结合大语言模型与外部工具而本质非确定性。arXiv论文提出agrepl框架,通过MITM代理拦截外部交互,实现运行轨迹的确定性重放,并凭噪声感知差异算法区分HTTP头部变化。实验显示重放保真度F=1.0,单步延迟降低98.3%。

  • AI代理系统(LLM+工具/API)的运行本质上非确定,难以复现。
  • agrepl框架使用MITM代理记录全部外部交互,并在隔离环境中重放。
站内正文

PlanFlip:通过规划阶段提示注入攻击多智能体LLM系统

一项新研究提出PlanFlip框架,包含四种针对多智能体LLM系统规划阶段的提示注入攻击。研究发现,更强的模型(如GPT-5)反而更易受攻击,同质化骨干网络存在相关智能体盲点,而推理增强型模型(如DeepSeek-R1)能抵御攻击。提出的两种防御方法检测率高达1.00。

  • PlanFlip引入四种针对多智能体系统规划阶段的提示注入攻击。
  • 更强的模型(如GPT-5)攻击成功率更高,挑战了能力即安全的假设。
站内正文

一些大型语言模型表现出一致的风险态度

一项新研究通过跨领域框架测试了大型语言模型(LLMs)在不确定性下的风险态度,发现大多数模型在任务内和跨任务中都表现出稳定且一致的风险偏好,且其风险态度分布比人类更集中。

  • 研究引入跨领域框架,将情境风险信念与类别决策分离,测试了6个LLM和100名人类参与者。
  • 大多数LLM在空间导航、临床分诊和财务分配任务中表现出稳健的任务内一致性。
站内正文

轻量级1D CNN的设计与验证:用于软毛绒伴侣的情感触觉分类

本研究提出了一种基于MATLAB的开源框架,用于开发软交互伴侣中的情感触觉识别紧凑深度学习模型。通过468个CNN模型的系统探索,确定了13.2k参数的扩张1D CNN为最佳方案,测试准确率75%,留一法交叉验证准确率85%。混合推理管道结合瞬时启发式滤波和CNN精细分类,可在20 Hz实时运行,实现隐私保护的情感触觉解读。

  • 公开了1326个手势序列的FAIR兼容数据集,涵盖25名参与者。
  • 13.2k参数的1D CNN达到75%测试准确率和85%留一法交叉验证准确率。
站内正文

Concentrate: LLM网关

Concentrate 是一个托管的LLM网关,提供单一API访问超过130个来自主要供应商的模型。它具备模型路由、支出跟踪、安全控制和故障转移冗余等功能,专为扩展AI生产的团队设计。

  • 单一API可访问来自OpenAI、Anthropic、Google等提供商的130多个模型。
  • 内置数据脱敏、零数据保留、审计日志、SSO和RBAC等安全功能。
站内正文

开放权重AI是减速主义的吗?

OpenAI战略未来主管Dean Ball认为开放权重模型本质上是减速主义的,因为它们抑制资本支出。本文从经济学角度探讨了这一观点,分析了中国在AI基础设施方面的投资、训练范式的转变以及价值在价值链中的迁移。文章认为,开放权重模型可能通过降低成本扩大应用范围,促进创新,从而实际上是加速主义的。

  • Dean Ball声称开放权重模型是减速主义的,因为它减少了资本投资。
  • 中国可能通过补贴产能和压缩利润加剧这一趋势。
站内正文

Colibrì概念验证:用25GB内存运行1.5TB的AI模型

意大利工程师Vincenzo(又名JustVugg)创建了Colibrì,这是一个概念验证项目,能够在仅25GB RAM和1GB/s NVMe的CPU上运行7440亿参数的GLM-5.2模型(1.5TB)。尽管速度极慢(每0.05-0.1秒一个token),但利用混合专家(MoE)架构按token加载专家,实现了前沿水平的回答质量。项目开源,旨在探索在消费级硬件上运行大型模型的可行性。

  • Colibrì在低端硬件上运行1.5TB的GLM-5.2模型,速度仅0.05-0.1 token/秒。
  • 利用MoE架构按token加载专家子模型,通过反复加载/卸载适应有限内存。
站内正文

GPT-5.6 Sol 与 Kimi K3 在《坎巴拉太空计划》中实时竞速直播

直播中,GPT-5.6 Sol 与 Kimi K3 在《坎巴拉太空计划》里进行速度竞赛,展示 AI 在复杂游戏中的实时决策能力。

  • GPT-5.6 Sol 和 Kimi K3 在 Twitch 直播中竞速《坎巴拉太空计划》。
  • 比赛考验 AI 的实时规划与操作技巧。
站内正文

阿里通义实验室发布Qwen-Audio-3.0-TTS:支持16种语言的Flash和Plus两档托管文本转语音模型

阿里通义实验室推出Qwen-Audio-3.0-TTS,一款面向生产的文本转语音系统,提供Flash(实时交互)和Plus(高质量生成)两档,通过阿里云模型托管服务交付。该模型覆盖16种语言和20种中文方言,支持自然语言风格控制和86种细粒度内联标签,并在Artificial Analysis语音竞技场中排名第一。文章详细介绍了模型架构、性能表现、开发者反馈及定价信息。

  • Qwen-Audio-3.0-TTS提供Flash(约300毫秒首包延迟)和Plus(质量优先)两个版本,均为API托管服务。
  • Plus版本在Artificial Analysis竞技场Elo评分约1236,每百万字符价格约27.59美元,但吞吐量仅约16字符/秒。
站内正文

逆向工程现在变得便宜了

不断有用户分享他们利用编码代理逆向工程并自动化家中设备的轶事。这展示了编码成本降低带来的影响。过去,逆向工程虽然可行,但投资回报率低,且需面对不稳定API的维护风险。编码代理彻底改变了这一局面,降低了初始工作和失败的成本,也减轻了未来维护的心理负担。

  • 编码代理降低了逆向工程和自动化的门槛
  • 过去因成本高、维护风险大而不值得做的项目现在变得可行
站内正文

谁在害怕中国模型?

本·汤普森提出美国应立法明确训练数据为合理使用,并禁止禁止蒸馏的服务条款,以帮助美国开源模型与中国模型竞争。同时,阿里巴巴决定发布Qwen 3.8 Max开源权重,可能受习近平鼓励开源合作的讲话影响。

  • 本·汤普森建议美国立法将训练数据收集定为合理使用,并禁止禁止蒸馏的服务条款。
  • 蒸馏(即查询API)几乎无法阻止,美国应转变政策,鼓励通过训练成果推动创新。
站内正文

Kimi K3:开放权重升级

Moonshot AI发布了最新旗舰模型Kimi K3,这是一个2.8万亿参数的MoE模型,将于7月27日开放权重。K3在多项基准测试中排名靠前,成为最强的开源模型。文章探讨了中美AI模型差距缩小、中国开源策略、开源模型的经济影响以及中国AI的效率优势。

  • Kimi K3是2.8T参数的MoE模型,开放权重,性能接近前沿闭源模型。
  • 中国AI实验室展示出独立创新能力,而不仅仅是快速追随。
站内正文

Adobe '自然外观'相机应用拥抱生成式AI

Adobe的实验性相机应用Indigo最初专注于为iPhone摄影提供更自然的单反效果,现在通过'AI Playground'套件增加了生成式AI编辑功能,使用Google的Nano Banana模型。功能包括AI风格、物体移除、照片指导和自定义编辑。该实验目前向一小部分用户提供免费访问,将来可能转为付费。

  • Adobe的Indigo应用添加了生成式AI编辑功能,名为'AI Playground'套件。
  • 采用Google的Nano Banana模型,而非Adobe自家的Firefly,未来可能更换。
站内正文
创业融资

CoreCtic AI – 将AI API成本转化为利润中心

CoreCtic AI 是一个分析型AI代理,专为转售商设计,可将AI API成本转化为利润中心。它支持多个AI提供商,提供智能缓存、实时分析和利润跟踪功能,帮助用户监控和优化AI使用成本。

  • 支持11个AI提供商,统一管理。
  • 智能缓存减少重复查询成本。
站内正文

告诉我们您在英国AI数据中心附近生活的经历

《卫报》邀请居住在AI数据中心附近的读者分享他们的经历和担忧。英国约有450个大型数据中心,这些设施引发了对土地使用、污染、噪音和热岛效应的争议。

  • 《卫报》征集英国AI数据中心附近居民的经历和意见
  • 英国约有450个大型数据中心,支撑云计算和AI服务
站内正文

Show HN:用AI将日常照片变为专业头像

Portraify是一款AI驱动的头像生成工具,用户上传1-3张日常照片即可在数秒内获得适合LinkedIn、简历和公司目录的专业头像。该服务免费提供3张头像,付费计划从9美元起,强调隐私保护(照片处理完后立即删除)和无需专业设备。

  • 上传1-3张日常照片,AI在1-2分钟内生成专业头像。
  • 免费提供3张头像,付费计划每次9-50美元,无订阅。
站内正文
研究

2026年最佳笔记平板电脑:专家测试与评测

我们测试并评测了市面上最佳的笔记平板电脑,涵盖苹果、亚马逊等品牌,适合学生、专业人士和创意工作者。

  • 笔记平板电脑提供手写笔支持及注释、同步、协作等功能。
  • 我们的首选轻薄便携,兼容Apple Pencil。
站内正文

人工智能聊天机器人的选举投票建议“不准确且不可靠”

一项在匈牙利选举期间进行的研究表明,AI聊天机器人在回答选民应支持哪个政党的问题时,推荐了未参选的政党,且对相同提示给出了高度不稳定的答案。该研究由公民自由组织Liberties发布,对通用AI系统在选举背景下的可靠性提出了严重担忧。

  • AI聊天机器人提供不准确的投票建议
  • 推荐未参选的政党,答案不稳定
站内正文

基于一维卷积神经网络的实时表面肌电信号辅助机器人臂远程控制

该研究提出了一种基于四通道表面肌电信号(sEMG)的实时接口,用于远程控制辅助机器人臂。通过一维卷积神经网络(CNN)分类,在仿真和实际平台上均实现了90%以上的分类准确率,平均延迟约0.32秒,证明了sEMG远程控制在辅助机器人领域的可行性。

  • 四通道sEMG结合一维CNN实现辅助机器人臂的实时远程控制
  • 测试准确率超过90%,平均延迟0.32秒,运动平滑可靠
站内正文

深度估计器作为隐式神经场用于3D场景几何修复与重建

本文提出神经深度场(NDF),将深度估计器视为场景级隐式场,通过单次测试时优化同时解决预测不一致和分布外数据不可靠的问题。实验表明,NDF在室内扫描到卫星图像等多种场景中生成高保真、全局一致的几何形状,跨视图不一致性降低63.3%,修复精度提升23.1%,达到最先进水平。

  • NDF将深度估计器与隐式神经场结合,通过测试时优化适应目标域并保持几何一致性。
  • 跨视图不一致性降低63.3%,修复精度提升23.1%。
站内正文

迈向可信赖的风险感知人脸检索(RA-FR)的一步

提出了一种风险感知人脸检索框架(RA-FR),通过混合盲脸修复、自监督特征提取和保形预测,在监控环境下实现自适应检索集大小,保证在指定风险水平内包含真实目标。

  • RA-FR替代固定Top-k检索,采用自适应集生成
  • 集成混合盲脸修复(InterLCM+DiffBIR)、自监督DINOv1特征和保形预测
站内正文

ForensicNet: 轻量级注意力增强MobileNetV2用于自动人脸识别

本文提出ForensicNet,一种轻量级深度学习框架,用于法医环境中的自动人脸识别。该模型结合MobileNetV2主干与CBAM注意力模块,采用两阶段迁移学习,在LFW和SCFace数据集上达到92.4%准确率,每推理仅需2.1 GFLOPs,适合实时法医监控。

  • ForensicNet集成MobileNetV2和CBAM注意力机制,平衡精度与效率
  • 两阶段迁移学习策略有效减少过拟合,提高领域适应性
站内正文

HantaWatch:用于汉坦病毒基因组监测的联邦学习框架

一种名为HantaWatch的联邦学习框架,允许实验室和监测站点在不共享原始数据的情况下协作训练基于序列的模型,提高了汉坦病毒疫情预测和专家优先排序能力。

  • HantaWatch使用联邦学习在分布式基因组数据上训练模型,无需集中敏感序列。
  • 它整合了k-mer特征提取、自适应优化和仅预测的分诊流程。
站内正文

正交梯度约束塑造噪声标签记忆动态

一项新研究介绍了OrthoGrad,一种对梯度更新进行几何干预的方法,它移除权重梯度的径向分量。在噪声标签图像分类实验中,OrthoGrad在小数据场景下提高了测试准确率,但并不能阻止最终对噪声标签的记忆。该方法可作为研究学习动态的有用诊断工具。

  • OrthoGrad通过将梯度投影到与权重向量正交的方向来修改优化器更新。
  • 在有限数据量的MNIST实验中,OrthoGrad提升了CNN的测试准确率并减少了对噪声标签的拟合。
站内正文

基于图神经网络的链接预测:技术、应用与挑战综述

本文系统综述了基于图神经网络(GNN)的链接预测方法,从新颖的GNN视角提出分类法,涵盖GCN、GAE、GAT和GFormer等编码器架构,并讨论在知识图谱和推荐系统中的应用,最后分析了当前挑战与未来方向。

  • 现有综述缺乏对GNN架构和多样图结构的系统探索。
  • 提出基于技术和应用的新分类法,涵盖四种主要GNN编码器。
站内正文

AI解决图论中20年未解猜想

研究人员利用AI(Lean证明助手)证明了一个20年历史的图论猜想:在半流式匹配中,贪心算法达到了最优近似比。这一结果被形式化验证,展示了AI在数学证明中的潜力。

  • 一项20年的图论猜想被解决:半流式匹配的贪心算法是最优的。
  • 证明由Sepehr Assadi、@mangooqwq和另一位研究者完成。
站内正文

人工智能让人自信地犯错

新研究揭示,人工智能辅助使人们变得过度自信且准确度降低,他们用AI生成的流畅表达替代真实知识,导致“认知投降”现象,并催生出“垃圾僵尸”——这些人自信地输出低质量内容。

  • 使用AI后,人们说“我不知道”的比例从44%降至3%,准确率从27%降至9%,而自信度从30%升至76%。
  • 机制是“流畅性替代”:人们接受貌似合理的AI答案而不加验证。
站内正文

Show HN: Codeground – 在浏览器中运行和共享代码

Codeground AI 是一个一体化开发者平台,提供在线 IDE、云工作区、技术面试工具及多种开发工具,支持 15+ 种语言,无需安装即可在浏览器中运行代码。

  • 免费使用,无需注册,支持 15+ 种编程语言和运行时
  • 提供 Docker 隔离的运行环境,确保安全
站内正文
政策

Z世代正生活在亲密经济中,情感连接被商品化 | 爱丽丝·拉斯曼

Z世代在人际关系中挣扎寻求安全感,AI伴侣填补了这一空白。一位27岁青年分手后更信任AI而非朋友,反映了亲密经济将情感连接货币化的趋势。

  • 一位27岁青年分手后与AI分享内心,胜过与朋友的交流
  • Z世代作为数字原住民,正从纯粹人际亲密过渡到亲密经济
站内正文

AI突破指南:2026年7月创新终极概览

2025年,AI写作服务已从边缘工具转变为核心生产力。本文深入探讨了最新突破,包括多模态生成、实时协作和伦理框架,并分析了它们如何重塑内容创作行业。

  • AI写作服务在2025年实现从实验工具到主流生产力的跃迁
  • 多模态生成和实时协作功能成为关键创新点
站内正文

AI营养标签

随着AI生成内容的激增,工作文档中充斥着可能包含幻觉和错误的“AI垃圾”。作者建议在工作成果中添加AI使用披露,类似于“营养标签”,以帮助同事评估可信度,同时促使自己反思判断中的空白。

  • AI辅助工作已成常态,但AI生成内容易出错,给读者带来认知负担。
  • 建议在文档或PR中添加脚注或标签,说明AI的使用方式。
站内正文

英国水务行业警告:数据中心发展面临水资源短缺

英国水务行业批评政府未考虑数据中心冷却用水需求,称AI发展计划“存在根本性缺陷”。数据中心需要大量水来冷却服务器,而政府规划未解决这一问题。

  • 英国水务行业指出,未来数据中心将面临水资源短缺。
  • 数据中心通过冷却塔、制冷机和加湿系统直接消耗大量水。
站内正文

可微分强化学习在敏捷仿生鱼机器人路径追踪中的应用

鱼形游泳启发了数十乃至数百种仿生机器人的设计,但由于流固耦合建模困难和非线性欠驱动动力学,其控制与运动规划极具挑战。本文开发了一个高效仿真平台,并利用可微分强化学习通过时间反向传播和课程训练学习PID控制器的变增益,然后将仿真中习得的策略成功迁移至物理平台,取得了高度吻合的效果。

  • 鱼形机器人因流固耦合与欠驱动动力学导致控制困难
  • 开发了计算高效的仿真平台近似机器人运动
站内正文

具有控制仿射动力学近似的可认证安全模型强化学习

提出一种安全的模型强化学习框架,通过学习控制仿射动力学并使用自适应共形预测量化不确定性,结合控制势垒函数实现可证明的安全策略。在推车杆和3D四旋翼平台上验证了有效性。

  • 利用控制仿射随机傅里叶特征建模机器人动力学,提高计算效率并减少模型偏差。
  • 采用自适应共形预测方法量化安全约束的不确定性,实现数据驱动的安全保障。
站内正文

S.E.A.G.R:具有双层文化与情感调节的社会情感感知问候机器人框架

本文介绍了SEAGR(社会情感感知问候机器人),一种针对多元文化背景和不同情绪状态用户的机器人问候框架。该框架通过双层调节机制,根据文化身份确定问候类型,并根据情感线索调整执行方式,结合文化映射、情感手势调节和空间距离管理,在Sense-Think-Act架构中实现。目前为概念验证,未来需通过用户研究进行实证验证。

  • SEAGR引入双层调节框架,文化身份决定问候类型,情感线索影响执行方式
  • 系统融合文化映射、情感手势调节和近体学规则
站内正文

可骑乘的动感双轮四足机器人控制设计

为重新激发年轻人对摩托车的兴趣,研究者开发了一款可骑乘的双轮机器人,配备四肢,具备动态四足步态。机器人采用自平衡双轮底座实现主要运动,四肢辅助上下车并协调运动,实现直观的基于重心转移的控制。本文聚焦于鲁棒的自平衡控制方法和自然四足运动控制策略。

  • 机器人结合双轮自平衡与四足辅助运动,减少电机输出和重量。
  • 四肢在快速移动时仍能保持稳定性。
站内正文

RLHF偏好数据中的评分者状态偏差:一个审计框架

该研究揭示了一种在人类反馈强化学习(RLHF)中存在的结构性混淆因素:评分者的心理状态可能随时间影响其偏好标签,从而产生系统性偏差。论文提出了一个审计框架用于检测这种偏差,并定义了相关概念、可证伪的预测和初步研究方案。

  • 研究指出RLHF中的偏好数据不仅反映响应质量,还可能编码评分者因压力等导致的情绪状态变化。
  • 这种状态依赖的偏差不同于普通分歧或随机噪声,且可能在奖励建模和策略优化中传播。
站内正文

AI刚刚推翻了一个重大数学难题。一位数学家解释道

数学家Levent Alpöge使用Anthropic的Fable 5人工智能找到了雅可比猜想的反例,但专家认为这缺乏洞察力。

  • Anthropic的Fable 5 AI找到了雅可比猜想的反例。
  • 数学家Andrew Blumberg表示,这并非重大突破,因为没有提供理解。
站内正文

在AI安全辩论中,意识问题是一个转移注意力的伪命题

约书亚·本吉奥关于先进AI系统可能拒绝被关闭的担忧值得认真对待,但将其视为意识的表现是危险的,因为这会助长拟人化倾向,并掩盖真正决定AI行为的人类设计与治理选择。

  • 将AI的自保行为与意识联系起来是危险的拟人化,会分散对安全问题的关注。
  • 许多系统如笔记本电脑的低电量警告也表现出工具性自保,但没有意识。
站内正文

美国人对AI的厌恶导致政客因数据中心项目丢掉工作

美国民众对人工智能的强烈反感正在影响政坛,犹他州一位资深议员因支持一个大型数据中心项目而落选。文章分析了围绕数据中心建设的多方利益冲突,包括科技公司、电力公司、社区领导人和普通居民,并指出选民的力量可以通过选举体现。

  • 2026年6月,犹他州参议院议长斯图尔特·亚当斯因支持数据中心项目被选民罢免。
  • 数据中心项目引发争议,涉及税收优惠、水电消耗、环境问题等。
站内正文

索尼起诉Udio AI音乐生成器侵犯3万首歌曲版权

索尼音乐娱乐再次起诉AI音乐生成器Udio,指控其侵犯了超过3万首歌曲的版权,包括猫王的《Hound Dog》、碧昂丝的《Say My Name》和哈里·斯泰尔斯的《As It Was》。索尼称这份名单只是侵权行为的一小部分。

  • 索尼起诉Udio侵犯3万首歌曲版权,涵盖猫王、碧昂丝等艺人。
  • 此前诉讼仅涉及333首作品,新诉讼扩大了范围。
站内正文

OpenAI广告收入目标或差90%

营销咨询公司Emarketer分析显示,OpenAI的五年广告收入预测可能低估90%,整个聊天机器人广告市场的总规模仅为54亿美元。到2026年,包括OpenAI、微软、谷歌和亚马逊在内的顶级AI公司广告总收入将不足10亿美元。OpenAI要实现其2030年广告收入1000亿美元的目标,需要三个奇迹同时发生。

  • OpenAI五年广告收入预测可能低估90%
  • 聊天机器人广告市场总规模仅为54亿美元
站内正文

我们所知的数学能否在人工智能时代幸存?

人工智能在数学领域取得惊人进展,从国际奥数金牌到解决数十年未解难题,引发数学家对学科未来的深刻担忧。《莱顿宣言》提出23点计划,呼吁保持数学以人为中心。数学家们对于是否接受AI、如何理解AI证明等问题存在分歧,并担心AI实验室对研究方向的控制。

  • AI已能解决博士级数学问题,速度远超人类
  • 《莱顿宣言》由3000多人签署,包括陶哲轩等顶尖数学家,旨在保护数学的人文性
站内正文

政府可征用私人土地建设AI数据中心输电线路

据《对话》报告,为满足AI数据中心激增的电力需求,电力公司可动用征用权强制购买私人土地以建设输电线路。美国已有数千个数据中心运营,但民众因土地、噪音、水耗等问题反对建设。征用权需证明公共用途,各州解释不同。2026年第一季度已有75个数据中心项目被成功阻止。

  • 电力公司可依据征用权强制购买私人土地用于建设AI数据中心输电线路。
  • 70%的美国人反对在附近建设数据中心,主要担忧包括土地、噪音、水耗和电力消耗。
站内正文

快速测试:您的AI项目是否触发欧盟AI法案?

这是一个为初创企业设计的快速测验,帮助判断其AI项目是否受欧盟AI法案的监管。

  • 测验旨在识别AI项目是否属于高风险类别。
  • 针对初创企业,简化合规评估流程。
站内正文

为什么我仍然推荐群晖DS225+ NAS——即使它不能替代你的云存储

硬盘价格飙升让NAS变得小众,但群晖DS225+依然值得推荐。本文分析了NAS成本上涨的原因(AI数据中心需求),对比了云存储的优势,并指出了NAS的适用人群。最终推荐DS225+,因其2.5GbE端口、SHR磁盘管理和优秀的DSM软件,尽管存在一些厂商限制。

  • AI数据中心需求导致硬盘和内存价格暴涨,NAS成本增加。
  • 云存储(如iCloud、Dropbox)价格稳定且方便,但仍需结合NAS使用。
站内正文
芯片

法国在AI竞赛中的优势是廉价能源

法国凭借丰富的核能提供低成本电力,在AI领域获得竞争优势,但美国科技巨头可能抢先将这一资源纳入囊中。

  • 法国拥有大量核能,电价低廉,有利于AI算力发展。
  • 美国科技公司如谷歌、微软等也在寻求清洁能源,可能抢占法国能源。
站内正文

智能变得过剩后,什么会变得稀缺?

AI行业面临两大对立策略:一是斥资数千亿美元建设核电站以支持更大规模的AI模型,二是发布可下载的开源模型,使智能几乎免费。文章指出这两种策略并非对立,而是对同一个问题的不同赌注:智能是否存在天花板?如果存在,效率阵营(开源、芯片架构)将获胜;如果需求无上限,蛮力阵营(大规模计算)将胜出。生物学提供了先例:人脑在能量限制下通过架构创新(稀疏性、内存计算)实现了高效。当前开源模型利用这些技巧,但仅覆盖中等难度的任务,而前沿模型仍保持优势。真正的胜负取决于智能天花板的位置。

  • AI行业投入巨资建设核电站与发布免费开源模型,看似相反实则是对智能天花板的不同赌注。
  • 生物大脑在20瓦功率下通过稀疏性和内存-计算融合等架构创新实现了高效。
站内正文

加里·马库斯:美国无法在AI战争中“战胜”中国,我们应该怎么做?

加里·马库斯指出,中国AI模型Kimi K3已追平美国顶级模型,且作为开源模型免费提供,冲击了美国AI公司的商业模式。他回顾了自己2025年以来的警告,认为美国过度依赖大语言模型(LLM)战略失误,导致如今中美AI竞争陷入僵局。马库斯提出七项建议,包括不作为、监管护城河、国有化等,并最终主张AI应成为全球公共品,提议建立类似CERN的国际AI合作项目。

  • 中国企业深度求索发布Kimi K3模型,性能媲美美国最佳模型且开源免费,引发美股下跌。
  • 马库斯认为美国AI公司如OpenAI和Anthropic的商业模式受质疑,IPO前景堪忧。
站内正文

将机器人视频转化为训练就绪数据

daft-physical-ai 是一个新的开源 Python 库,基于 Daft 构建,旨在简化物理 AI 中从原始机器人视频到训练模型的数据处理流程。它提供了手部追踪和奖励评分等操作,支持懒加载、批处理和分布式执行,帮助团队跳过数据管道的基础设施工作。

  • daft-physical-ai 是一个开源 Python 库,用于将机器人视频转化为可直接用于模型训练的数据。
  • 当前支持两个用例:手部追踪(支持 MediaPipe 和 WiLoR)和奖励评分(使用 Robometer-4B 模型)。
站内正文

你的指数基金中的SpaceX:解析

本文探讨了SpaceX快速纳入纳斯达克100指数对指数基金投资者的影响。文章解释了指数基金的工作原理,讨论了人们对埃隆·马斯克治理方式的担忧,以及投资者是否应担心市场中的人工智能集中度。

  • SpaceX在IPO后不久被纳入纳斯达克100指数,迫使指数基金买入其股票。
  • 指数基金被认为是安全的投资方式,即使包括高风险股票如SpaceX。
站内正文

初创公司成立代工厂开发芯片材料

由英伟达、Meta和三星等创始成员组成的联盟,旨在减少对芯片中稀有材料的依赖。

  • 英伟达、Meta和三星等公司联合成立一家芯片材料代工厂。
  • 该代工厂旨在降低对稀土等稀有材料的依赖。
站内正文

旧金山餐厅因AI菜单图片遭愤怒抵制

旧金山一家新开的餐厅因使用AI生成的菜单图片而遭到社区强烈批评,甚至被涂鸦破坏。店主不得不撤下图片,并计划通过社区活动重建声誉。

  • AJ和Lyndsey Lozano在Haight Street新开的Grind & Unwind餐厅因AI菜单图片引发争议。
  • Reddit帖子批评这些图片像“垃圾食品”,社区反应强烈,甚至出现涂鸦破坏。