AI News HubLIVE

今日必读

Agent

2026年7月:LangChain 新闻通讯 — NemoClaw 蓝图、OpenWiki Brains 等

本期内容包括:Jensen Huang 与 Harrison 探讨开放代理系统的未来,发布 NVIDIA NemoClaw for LangChain Deep Agents 蓝图;LangSmith Sandboxes 免费试用、Fleet Slack 集成、语音追踪;开源项目 OpenWiki Brains、Deep Agents 与 Harbor 统一评估栈、RLMs 动态子代理;新课程《Deep Agents 入门》;以及多场线下活动和客户案例。

  • Jensen Huang 和 Harrison 强调开放代理系统的重要性,并推出 NemoClaw 蓝图。
  • LangSmith 推出 Sandboxes 免费试用、Slack 集成和语音追踪功能。
站内正文

从评估到护栏:我们在ACM FAccT 2026上的贡献

Mozilla AI团队在ACM FAccT 2026会议上展示了一项关于上下文评估LLM护栏的教程,强调了评估护栏本身的重要性,并介绍了他们通过难民和庇护场景的评估结果来设计动态护栏政策的方法,以及使用工具增强护栏可靠性的实践。

  • 评估是AI安全的核心,而护栏应受到与模型同等的 scrutiny。
  • 团队通过120个难民和庇护场景,评估了LLM在多种语言下的表现,并基于结果制定了具体的护栏政策。
站内正文

为智能体时代做准备:Databricks如何构建自助基础设施自动售货机

Databricks 的现场工程组织为帮助客户成功而构建了 FE 自动售货机(FEVM),这是一个基于 Databricks Apps 的自助服务基础设施平台,可按需提供隔离、受治理的云资源。随着 GTM 团队规模增长到 7000 多人,共享工作区带来了操作复杂性、成本归属和可观察性问题。FEVM 通过用例驱动配置、自动生命周期管理和透明通知解决了这些问题,在内部活动 BuildCon 中一天处理了近 1200 个配置请求。它支持人工工程师和智能体工作流,是 Databricks 智能体优先现场工程愿景的关键基础设施层。

  • Databricks 构建了 FEVM,一个用于现场工程师的自助基础设施配置平台,基于 Databricks Apps、Terraform 和 Git 构建。
  • FEVM 提供隔离、受治理的云环境,支持用例驱动配置和自动生命周期管理(默认 90 天后过期)。
站内正文

我们如何对深度代理进行基准测试

深度代理的开发因评估困难而颇具挑战。我们最近改进了评估框架,利用 Harbor 在编码、对话和检索三大领域进行端到端评估,并分享了我们的实践方法。

  • 使用 Harbor 进行端到端评估,包含环境、指令和评估脚本。
  • 三大基准测试:Harbor-Index(自主工作)、τ³-bench(对话)、ContextBench(检索)。
站内正文

Cursor、Ramp 和 Meta 都在构建模型路由器——但其中两家自身有着重大模型抱负

Cursor 推出模型路由器 Cursor Router,可根据任务需求自动选择最合适的 AI 模型,节省成本并保持质量。Ramp 和 Meta 也发布了类似工具。Cursor 自身也在开发强大模型,并开始掌控自己的 AI 堆栈。

  • Cursor Router 通过分诊系统将编码请求分配给最合适的模型,宣称可节省 30-50% 成本。
  • Cursor 已发布自家模型 Grok 4.5 和 Composer 2.5,构建自有 AI 堆栈。
站内正文
工具

Patreon 裁员20%

Patreon 宣布裁员20%,约93名员工。CEO Jack Conte 表示裁员并非因AI取代人类,而是AI已从根本上改变科技行业和公司运营方式。此前Patreon在2022年已裁员17%,并关闭了都柏林和柏林办事处。

  • Patreon 裁员20%,约93名员工
  • CEO Jack Conte 称裁员是适应AI带来的行业变革
站内正文

AI赌注失误:甲骨文解雇21,000名员工

据报道,甲骨文因一项人工智能赌注失误而解雇了21,000名员工。这一大规模裁员反映了公司在AI战略上的重大挫折。

  • 甲骨文解雇21,000名员工
  • 裁员与AI赌注失误有关
站内正文
模型

“我们喜欢两种模型都能使用的世界”:NVIDIA如何看待本地模型与前沿模型

NVIDIA高级总监Joey Conway表示,本地小型模型与前沿大模型正协同工作,通过路由器分配任务,企业可借此降低成本、提高效率。NVIDIA推出DGX Spark等硬件支持本地运行大模型,并强调数据控制与安全性。

  • NVIDIA提倡本地模型与前沿模型相结合,通过路由器分配简单与复杂任务。
  • 企业可使用DGX Spark等设备本地运行高达2000亿参数的模型,完全控制数据。
站内正文

你并未得到你付费的AI模型

这篇文章探讨了AI模型供应商在API调用中进行的隐性模型替换、精度降级和权重漂移现象。这些做法引发了严重的合同、法律和证据认证问题。作者分析了三种模型身份断裂的方式,并指出当前法律框架无法适应这种动态路由,提议通过可验证的模型签名来解决身份认证问题。

  • 模型替换:请求被分类器转向不同架构的模型,用户可能收到未经选择的模型输出。
  • 精度降级:相同模型以降低精度提供服务,输出可能偏离预期。
站内正文

你不需要LLM来聚类LLM追踪记录

一种使用合约块哈希和确定性特征而非LLM摘要来聚类LLM追踪记录的技术,以极低的模型成本实现了近乎完美的精确率和召回率。Seldon的Trace Audit通过硬合约块和块内DBSCAN,按程序身份而非主题聚类,并识别可编译的工作流以替换为更便宜的确定性流水线。

  • Seldon的Trace Audit使用硬合约块和基于确定性特征字符串的块内DBSCAN按程序身份而非主题聚类追踪记录。
  • LLM生成的摘要会降低纯度并增加不必要成本;最好在聚类后用于标签。
站内正文
其余更新(12 条)
政策

在人工智能时代重新思考法律教育

芝加哥大学法学院发布了一项战略声明,阐述其如何适应人工智能时代,包括开发抗AI的教学法、提升人类核心技能以及教授负责任地使用AI。该学院计划在2026-2027学年试点新政策,如1L核心课程禁止电子设备、进行无网络考试,并在法律研究与写作课程中结合AI使用。

  • 芝加哥大学法学院制定了一个三部分战略愿景:抗AI教学法、提升人类必备技能、教授负责任地使用AI。
  • 2026-2027学年将试点1L核心课程无设备、苏格拉底式教学法和无网络考试。
站内正文

在Amazon QuickSight中使用Highcharts构建多区域可视化

本文介绍如何使用Highcharts自定义可视化在QuickSight中构建多区域运营商绩效仪表板,克服原生图表限制,同时通过QuickSight联合数据集能力维护跨AWS区域的数据主权。解决方案包括生产就绪的图表配置,并满足安全、合规和可扩展性要求。

  • 通过Highcharts自定义可视化解决QuickSight原生图表无法处理多区域运营商绩效数据的结构差异问题。
  • 利用QuickSight联合数据集实现跨区域数据聚合,无需移动原始数据,满足数据主权要求。
站内正文
Agent

Show HN:Setoku – 面向AI代理的自托管知识服务器

Setoku 是一个开源的、自托管的 MCP 知识服务器,为 AI 代理提供对公司数据的只读访问、指标定义和陷阱的记忆,以及构建和共享仪表板的能力。它运行在廉价 VPS 上,无需模型推理成本,并强调安全性——知识更新需要人工批准。

  • Setoku 是一个自托管 MCP 服务器,让 AI 代理查询公司数据,同时理解其含义。
  • 提供只读查询、上下文工具和应用发布功能,支持人类审核知识变更。
站内正文

评估AI代理:使用Strands和AgentCore的生产蓝图

Motorway与AWS合作构建了端到端评估管道,将错误结果从每8次查询1次减少到每50次1次,并将问题检测时间从几小时缩短到几分钟。该管道结合了Strands Agents SDK与Amazon Bedrock AgentCore,本文介绍了如何为您的代理构建此管道。

  • Motorway与AWS合作构建AI驱动的经销商库存搜索代理,将自然语言查询转化为搜索结果。
  • 两阶段评估策略:构建时测试(strands-agents-evals)和生产监控(Amazon Bedrock AgentCore Evaluations)。
站内正文

使用Amazon Bedrock AgentCore优化检测静默代理故障

Amazon Bedrock AgentCore优化能够发现生产环境中AI代理的静默行为故障——那些通过所有健康检查但产生错误结果的故障。了解如何通过洞察发现、解释和排序跨会话的故障模式,从而优先修复影响最大的问题。

  • 静默故障不会产生错误信号,但会导致错误结果,如订单未执行或库存状态错误。
  • AgentCore通过分析会话跟踪数据,发现11种行为故障类型,包括幻觉、错误操作等。
站内正文

面向Amazon Bedrock托管知识库的智能检索

经典检索在应对多部分、比较性和探索性问题时表现不佳,而智能检索通过规划循环分解查询、逐意图检索并评估充分性,提供更精准的结果。本文深入探讨智能检索的工作原理、API使用方法及适用场景。

  • 单次检索在多意图查询中难以有效工作。
  • 智能检索使用基础模型分解查询、迭代检索并判断是否足够。
站内正文

针对智能体关键行动的价值投毒基准测试

本文介绍了一套评估AI模型是否会执行来自不可信文档的伪造值的基准测试。在十项关键工作流中,所有被测试的模型(从四个提供商)均表现出程度不同的脆弱性,且防护措施ActionRail成功阻止了所有被污染的操作,且无误报。

  • 针对AI智能体在实际行动中执行伪造值的风险提出了新的基准测试方法。
  • 测试了来自四个提供商的八种模型,发现所有模型均存在脆弱性,脆弱率从1.7%到63.3%不等。
站内正文

为什么Linus是对的而AI是错的

本文分析Linus Torvalds关于AI在Linux内核开发中的立场的邮件,指出Linus将AI视为工具并强调技术至上,作者认为这是合理的,但批评了AI炒作机器对Linus言论的利用和断章取义。文章深入探讨了修辞手法、文本分析中的“解经”与“强解”,以及如何识别对权威话语的武器化。

  • Linus Torvalds明确表示Linux内核项目不反对AI,反对者可以分支或离开。
  • 作者认为Linus的立场合理,但警告AI支持者不应滥用其言论压制批评者。
站内正文
芯片

推进AI 2026 – 与AMD共建未来 [视频]

AMD在AI领域的布局与未来展望,聚焦2026年的技术突破与产品路线图。

  • AMD发布AI加速器与芯片路线图
  • 强调开放软件生态与开发者支持
站内正文
工具

OpenAI 全面推出 ChatGPT Health:声称模型推理能力超越临床医生

OpenAI 于周四在美国向所有用户推出 ChatGPT Health,允许用户连接医疗记录和健康追踪数据。该公司高管称模型推理能力已超越临床医生水平,但随后又对声明进行缓和。与此同时,一位牧师因 ChatGPT 提供“极其危险的医疗建议”而提起诉讼。

  • ChatGPT Health 现已向美国所有 18 岁及以上用户开放,可在免费、Go、Plus 和 Pro 计划中使用。
  • OpenAI 高管最初声称模型推理能力优于临床医生,但随后被健康业务负责人淡化。
站内正文
机器人
模型

构建交易助手:Jefferies如何利用AI优化前台交易操作

Jefferies 使用 Strands Agents、Amazon Bedrock 和 MCP 工具构建了代理型 AI 交易助手,使交易员能够通过自然语言查询数据,减少对 IT 的依赖并加速洞察。

  • Jefferies 部署了集成了 Strands Agents、Amazon Bedrock 和 MCP 工具的 AI 交易助手。
  • 交易员可以通过自然语言提问,实时获取 SQL 生成的洞察和可视化结果。