AI News HubLIVE

今日必讀

Agent

2026年7月:LangChain 新聞通訊 — NemoClaw 藍圖、OpenWiki Brains 等

本期內容包括:Jensen Huang 與 Harrison 探討開放代理系統的未來,釋出 NVIDIA NemoClaw for LangChain Deep Agents 藍圖;LangSmith Sandboxes 免費試用、Fleet Slack 整合、語音追蹤;開源專案 OpenWiki Brains、Deep Agents 與 Harbor 統一評估棧、RLMs 動態子代理;新課程《Deep Agents 入門》;以及多場線下活動和客戶案例。

  • Jensen Huang 和 Harrison 強調開放代理系統的重要性,並推出 NemoClaw 藍圖。
  • LangSmith 推出 Sandboxes 免費試用、Slack 整合和語音追蹤功能。
站內正文

從評估到護欄:我們在ACM FAccT 2026上的貢獻

Mozilla AI團隊在ACM FAccT 2026會議上展示了一項關於上下文評估LLM護欄的教程,強調了評估護欄本身的重要性,並介紹了他們透過難民和庇護場景的評估結果來設計動態護欄政策的方法,以及使用工具增強護欄可靠性的實踐。

  • 評估是AI安全的核心,而護欄應受到與模型同等的 scrutiny。
  • 團隊透過120個難民和庇護場景,評估了LLM在多種語言下的表現,並基於結果制定了具體的護欄政策。
站內正文

為智慧體時代做準備:Databricks如何構建自助基礎設施自動售貨機

Databricks 的現場工程組織為幫助客戶成功而構建了 FE 自動售貨機(FEVM),這是一個基於 Databricks Apps 的自助服務基礎設施平臺,可按需提供隔離、受治理的雲資源。隨著 GTM 團隊規模增長到 7000 多人,共享工作區帶來了操作複雜性、成本歸屬和可觀察性問題。FEVM 透過用例驅動配置、自動生命週期管理和透明通知解決了這些問題,在內部活動 BuildCon 中一天處理了近 1200 個配置請求。它支援人工工程師和智慧體工作流,是 Databricks 智慧體優先現場工程願景的關鍵基礎設施層。

  • Databricks 構建了 FEVM,一個用於現場工程師的自助基礎設施配置平臺,基於 Databricks Apps、Terraform 和 Git 構建。
  • FEVM 提供隔離、受治理的雲環境,支援用例驅動配置和自動生命週期管理(預設 90 天后過期)。
站內正文

我們如何對深度代理進行基準測試

深度代理的開發因評估困難而頗具挑戰。我們最近改進了評估框架,利用 Harbor 在編碼、對話和檢索三大領域進行端到端評估,並分享了我們的實踐方法。

  • 使用 Harbor 進行端到端評估,包含環境、指令和評估指令碼。
  • 三大基準測試:Harbor-Index(自主工作)、τ³-bench(對話)、ContextBench(檢索)。
站內正文

Cursor、Ramp 和 Meta 都在構建模型路由器——但其中兩家自身有著重大模型抱負

Cursor 推出模型路由器 Cursor Router,可根據任務需求自動選擇最合適的 AI 模型,節省成本並保持質量。Ramp 和 Meta 也釋出了類似工具。Cursor 自身也在開發強大模型,並開始掌控自己的 AI 堆疊。

  • Cursor Router 透過分診系統將編碼請求分配給最合適的模型,宣稱可節省 30-50% 成本。
  • Cursor 已釋出自家模型 Grok 4.5 和 Composer 2.5,構建自有 AI 堆疊。
站內正文
工具

Patreon 裁員20%

Patreon 宣佈裁員20%,約93名員工。CEO Jack Conte 表示裁員並非因AI取代人類,而是AI已從根本上改變科技行業和公司運營方式。此前Patreon在2022年已裁員17%,並關閉了都柏林和柏林辦事處。

  • Patreon 裁員20%,約93名員工
  • CEO Jack Conte 稱裁員是適應AI帶來的行業變革
站內正文

AI賭注失誤:甲骨文解僱21,000名員工

據報道,甲骨文因一項人工智慧賭注失誤而解僱了21,000名員工。這一大規模裁員反映了公司在AI戰略上的重大挫折。

  • 甲骨文解僱21,000名員工
  • 裁員與AI賭注失誤有關
站內正文
模型

“我們喜歡兩種模型都能使用的世界”:NVIDIA如何看待本地模型與前沿模型

NVIDIA高階總監Joey Conway表示,本地小型模型與前沿大模型正協同工作,透過路由器分配任務,企業可藉此降低成本、提高效率。NVIDIA推出DGX Spark等硬體支援本地執行大模型,並強調資料控制與安全性。

  • NVIDIA提倡本地模型與前沿模型相結合,透過路由器分配簡單與複雜任務。
  • 企業可使用DGX Spark等裝置本地執行高達2000億引數的模型,完全控制資料。
站內正文

你並未得到你付費的AI模型

這篇文章探討了AI模型供應商在API呼叫中進行的隱性模型替換、精度降級和權重漂移現象。這些做法引發了嚴重的合同、法律和證據認證問題。作者分析了三種模型身份斷裂的方式,並指出當前法律框架無法適應這種動態路由,提議透過可驗證的模型簽名來解決身份認證問題。

  • 模型替換:請求被分類器轉向不同架構的模型,使用者可能收到未經選擇的模型輸出。
  • 精度降級:相同模型以降低精度提供服務,輸出可能偏離預期。
站內正文

你不需要LLM來聚類LLM追蹤記錄

一種使用合約塊雜湊和確定性特徵而非LLM摘要來聚類LLM追蹤記錄的技術,以極低的模型成本實現了近乎完美的精確率和召回率。Seldon的Trace Audit透過硬合約塊和塊內DBSCAN,按程式身份而非主題聚類,並識別可編譯的工作流以替換為更便宜的確定性流水線。

  • Seldon的Trace Audit使用硬合約塊和基於確定性特徵字串的塊內DBSCAN按程式身份而非主題聚類追蹤記錄。
  • LLM生成的摘要會降低純度並增加不必要成本;最好在聚類後用於標籤。
站內正文
其餘更新(12 條)
政策

在人工智慧時代重新思考法律教育

芝加哥大學法學院釋出了一項戰略宣告,闡述其如何適應人工智慧時代,包括開發抗AI的教學法、提升人類核心技能以及教授負責任地使用AI。該學院計劃在2026-2027學年試點新政策,如1L核心課程禁止電子裝置、進行無網路考試,並在法律研究與寫作課程中結合AI使用。

  • 芝加哥大學法學院制定了一個三部分戰略願景:抗AI教學法、提升人類必備技能、教授負責任地使用AI。
  • 2026-2027學年將試點1L核心課程無裝置、蘇格拉底式教學法和無網路考試。
站內正文

在Amazon QuickSight中使用Highcharts構建多區域視覺化

本文介紹如何使用Highcharts自定義視覺化在QuickSight中構建多區域運營商績效儀表板,克服原生圖表限制,同時透過QuickSight聯合資料集能力維護跨AWS區域的資料主權。解決方案包括生產就緒的圖表配置,並滿足安全、合規和可擴充套件性要求。

  • 透過Highcharts自定義視覺化解決QuickSight原生圖表無法處理多區域運營商績效資料的結構差異問題。
  • 利用QuickSight聯合資料集實現跨區域資料聚合,無需移動原始資料,滿足資料主權要求。
站內正文
Agent

Show HN:Setoku – 面向AI代理的自託管知識伺服器

Setoku 是一個開源的、自託管的 MCP 知識伺服器,為 AI 代理提供對公司資料的只讀訪問、指標定義和陷阱的記憶,以及構建和共享儀表板的能力。它執行在廉價 VPS 上,無需模型推理成本,並強調安全性——知識更新需要人工批准。

  • Setoku 是一個自託管 MCP 伺服器,讓 AI 代理查詢公司資料,同時理解其含義。
  • 提供只讀查詢、上下文工具和應用釋出功能,支援人類稽核知識變更。
站內正文

評估AI代理:使用Strands和AgentCore的生產藍圖

Motorway與AWS合作構建了端到端評估管道,將錯誤結果從每8次查詢1次減少到每50次1次,並將問題檢測時間從幾小時縮短到幾分鐘。該管道結合了Strands Agents SDK與Amazon Bedrock AgentCore,本文介紹瞭如何為您的代理構建此管道。

  • Motorway與AWS合作構建AI驅動的經銷商庫存搜尋代理,將自然語言查詢轉化為搜尋結果。
  • 兩階段評估策略:構建時測試(strands-agents-evals)和生產監控(Amazon Bedrock AgentCore Evaluations)。
站內正文

使用Amazon Bedrock AgentCore最佳化檢測靜默代理故障

Amazon Bedrock AgentCore最佳化能夠發現生產環境中AI代理的靜默行為故障——那些透過所有健康檢查但產生錯誤結果的故障。瞭解如何透過洞察發現、解釋和排序跨會話的故障模式,從而優先修復影響最大的問題。

  • 靜默故障不會產生錯誤訊號,但會導致錯誤結果,如訂單未執行或庫存狀態錯誤。
  • AgentCore透過分析會話跟蹤資料,發現11種行為故障型別,包括幻覺、錯誤操作等。
站內正文

面向Amazon Bedrock託管知識庫的智慧檢索

經典檢索在應對多部分、比較性和探索性問題時表現不佳,而智慧檢索透過規劃迴圈分解查詢、逐意圖檢索並評估充分性,提供更精準的結果。本文深入探討智慧檢索的工作原理、API使用方法及適用場景。

  • 單次檢索在多意圖查詢中難以有效工作。
  • 智慧檢索使用基礎模型分解查詢、迭代檢索並判斷是否足夠。
站內正文

針對智慧體關鍵行動的價值投毒基準測試

本文介紹了一套評估AI模型是否會執行來自不可信文件的偽造值的基準測試。在十項關鍵工作流中,所有被測試的模型(從四個提供商)均表現出程度不同的脆弱性,且防護措施ActionRail成功阻止了所有被汙染的操作,且無誤報。

  • 針對AI智慧體在實際行動中執行偽造值的風險提出了新的基準測試方法。
  • 測試了來自四個提供商的八種模型,發現所有模型均存在脆弱性,脆弱率從1.7%到63.3%不等。
站內正文

為什麼Linus是對的而AI是錯的

本文分析Linus Torvalds關於AI在Linux核心開發中的立場的郵件,指出Linus將AI視為工具並強調技術至上,作者認為這是合理的,但批評了AI炒作機器對Linus言論的利用和斷章取義。文章深入探討了修辭手法、文本分析中的“解經”與“強解”,以及如何識別對權威話語的武器化。

  • Linus Torvalds明確表示Linux核心專案不反對AI,反對者可以分支或離開。
  • 作者認為Linus的立場合理,但警告AI支持者不應濫用其言論壓制批評者。
站內正文
晶片

推進AI 2026 – 與AMD共建未來 [影片]

AMD在AI領域的佈局與未來展望,聚焦2026年的技術突破與產品路線圖。

  • AMD釋出AI加速器與晶片路線圖
  • 強調開放軟體生態與開發者支援
站內正文
工具

OpenAI 全面推出 ChatGPT Health:聲稱模型推理能力超越臨床醫生

OpenAI 於週四在美國向所有使用者推出 ChatGPT Health,允許使用者連線醫療記錄和健康追蹤資料。該公司高管稱模型推理能力已超越臨床醫生水平,但隨後又對宣告進行緩和。與此同時,一位牧師因 ChatGPT 提供“極其危險的醫療建議”而提起訴訟。

  • ChatGPT Health 現已向美國所有 18 歲及以上使用者開放,可在免費、Go、Plus 和 Pro 計劃中使用。
  • OpenAI 高管最初聲稱模型推理能力優於臨床醫生,但隨後被健康業務負責人淡化。
站內正文
機器人
模型

構建交易助手:Jefferies如何利用AI最佳化前臺交易操作

Jefferies 使用 Strands Agents、Amazon Bedrock 和 MCP 工具構建了代理型 AI 交易助手,使交易員能夠透過自然語言查詢資料,減少對 IT 的依賴並加速洞察。

  • Jefferies 部署了整合了 Strands Agents、Amazon Bedrock 和 MCP 工具的 AI 交易助手。
  • 交易員可以透過自然語言提問,即時獲取 SQL 生成的洞察和視覺化結果。