AI News HubLIVE
公開文章 121採集文章 129可信度 84刷新頻率 30 分鐘
健康狀態 健康來源類型 研究原文權限 允許原文最近入庫 2026-08-07ID langchain-blog運行狀態 已啟用

Technical tool blog; verify individual post terms before full body display.

最新公開文章

待翻譯:Managed Deep Agents is now in public beta

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Deploy Deep Agents to a managed LangSmith runtime with durable execution, memory, sandboxes, channels, evals, and production-ready infrastructure.

  • AI 服務暫時不可用,系統已先保留來源內容與降級後設資料。
  • Deploy Deep Agents to a managed LangSmith runtime with durable execution, memory, sandboxes, channels, evals, and production-ready infrastructure.
站內正文

待翻譯:Deep Agents vs LangChain vs LangGraph

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Deep Agents, LangChain, and LangGraph each offer distinct approaches to building agents. In this post, we cover the key distinctions between our open source frameworks and when you should reach for each one.

  • AI 服務暫時不可用,系統已先保留來源內容與降級後設資料。
  • Deep Agents, LangChain, and LangGraph each offer distinct approaches to building agents. In this post, we cover the key distinctions between our open source frameworks and when yo…
站內正文

待翻譯:How we built an autonomous SRE agent for Kubernetes

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Learn how LangChain built an autonomous SRE agent for Kubernetes deployments with Deep Agents, human approval for changes, LangSmith tracing, and evals.

  • AI 服務暫時不可用,系統已先保留來源內容與降級後設資料。
  • Learn how LangChain built an autonomous SRE agent for Kubernetes deployments with Deep Agents, human approval for changes, LangSmith tracing, and evals.
站內正文

待翻譯:How to Evaluate Voice Agents with LangSmith

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Learn how to evaluate voice agents across execution, outcomes, and caller experience using LangSmith traces, code evaluators, LLM judges, and human review.

  • AI 服務暫時不可用,系統已先保留來源內容與降級後設資料。
  • Learn how to evaluate voice agents across execution, outcomes, and caller experience using LangSmith traces, code evaluators, LLM judges, and human review.
站內正文

待翻譯:How Stripe Built Kai on Deep Agents in 1 Week

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Learn how Stripe built Kai, a company-wide AI agent on LangChain, LangGraph, and Deep Agents, reaching 5,000 users in roughly 4 weeks.

  • AI 服務暫時不可用,系統已先保留來源內容與降級後設資料。
  • Learn how Stripe built Kai, a company-wide AI agent on LangChain, LangGraph, and Deep Agents, reaching 5,000 users in roughly 4 weeks.
站內正文

使用 ReviewBench 評估程式碼審查代理

LangChain 構建了 ReviewBench,一個基於真實拉取請求反饋的基準,用於評估程式碼審查代理。文章介紹了從真實審查評論中篩選任務、執行方式、評分指標、初步結果以及未來方向。

  • ReviewBench 基於 LangSmith 倉庫中受信任審查者的真實 PR 評論構建。
  • 透過 LLM 門控和人工篩選將原始評論轉化為可驗證的基準任務。
站內正文

LangSmith LLM閘道器:為生產環境中的AI代理提供執行時控制

LangSmith LLM閘道器現已公開測試,為生產環境中的代理模型呼叫提供集中治理層,包括成本控制、速率限制、模型回退和敏感資料保護,幫助團隊避免供應商鎖定並有效管理模型使用。

  • LangSmith LLM閘道器作為代理與模型之間的集中治理層,提供執行時控制。
  • 支援成本上限、速率限制、模型回退和敏感資料編輯等關鍵控制。
站內正文

Similarweb如何使用LangSmith評估Agent報告

瞭解Similarweb如何使用LangSmith透過評分標準、忠實度檢查、追蹤和基線比較來評估長篇Agent研究報告。

  • 根據輸出型別匹配評估方法:標準答案適用於聚焦問題,而長篇報告需要評分標準、忠實度檢查和基線比較。
  • 將分數視為訊號而非答案:Similarweb使用LangSmith將每個分數與評估者評論、追蹤和A/B比較關聯起來。
站內正文

LangChain如何構建以代理為先的資料棧

LangChain資料團隊透過整合Hex、dbt、語義模型和可觀測性,構建了一個可靠的資料代理,將自助分析容量提升了40倍,同時將資料團隊的角色從回答每個問題轉變為改進系統。

  • 可靠的資料代理需要清晰的模型、指標定義、業務上下文和信任訊號。
  • 代理優先的棧可將自助服務擴充套件40倍,處理此前三人資料團隊的請求量。
站內正文

掌握你的智慧:實現持久AI優勢的關鍵

企業必須控制自己的代理系統、治理、上下文和反饋迴圈,才能將通用AI轉化為持久的業務優勢。本文闡述了為何通用AI不足以創造差異化,並提供了實現智慧所有權的具體策略,包括控制模型、編排、上下文,管理成本、質量和風險,以及構建持續改進的學習迴圈。

  • 通用AI無法提供持久的競爭優勢,企業需要針對自身業務定製的智慧。
  • 智慧所有權意味著控制代理系統的三層:模型、編排和上下文。
站內正文

2026年7月:LangChain 新聞通訊 — NemoClaw 藍圖、OpenWiki Brains 等

本期內容包括:Jensen Huang 與 Harrison 探討開放代理系統的未來,釋出 NVIDIA NemoClaw for LangChain Deep Agents 藍圖;LangSmith Sandboxes 免費試用、Fleet Slack 整合、語音追蹤;開源專案 OpenWiki Brains、Deep Agents 與 Harbor 統一評估棧、RLMs 動態子代理;新課程《Deep Agents 入門》;以及多場線下活動和客戶案例。

  • Jensen Huang 和 Harrison 強調開放代理系統的重要性,並推出 NemoClaw 藍圖。
  • LangSmith 推出 Sandboxes 免費試用、Slack 整合和語音追蹤功能。
站內正文

我們如何對深度代理進行基準測試

深度代理的開發因評估困難而頗具挑戰。我們最近改進了評估框架,利用 Harbor 在編碼、對話和檢索三大領域進行端到端評估,並分享了我們的實踐方法。

  • 使用 Harbor 進行端到端評估,包含環境、指令和評估指令碼。
  • 三大基準測試:Harbor-Index(自主工作)、τ³-bench(對話)、ContextBench(檢索)。
站內正文

評估工程技能:從倉庫上下文和追蹤構建評估

LangChain 釋出了評估工程技能,該技能透過檢查代理的倉庫結構和追蹤記錄,以訪談方式提出評估方案,並生成可執行的 Harbor 格式評估任務。

  • 新技能自動分析代理倉庫和追蹤,提出待測試能力。
  • 透過使用者訪談迭代完善評估,而非一次性生成。
站內正文

用LangGraph進行圖工程:三年經驗總結

本文總結了LangChain團隊三年來使用LangGraph構建代理系統的經驗。圖工程並非新概念,而是構建可靠代理的成熟方法。文章介紹了何時使用圖、何時避免使用圖,以及從實踐中總結的關鍵教訓:代理圖通常不是有向無環圖(DAG),迴圈是簡單的圖,動態轉換很重要。

  • 圖工程是透過圖表表示代理系統工作流的方法,平衡了確定性和自主性。
  • LangGraph自2023年推出以來,每月下載量超過6500萬次,被初創企業和大型企業廣泛採用。
站內正文

Apollo 如何利用 Deep Agents 和 LangSmith 構建 GTM AI

Apollo 使用 Deep Agents 和 LangSmith 驅動其 AI 助手,實現從潛在客戶挖掘、資訊豐富、外聯、分析到 MCP 整合的完整 GTM 迴圈。

  • Apollo 將 AI 助手從監督式架構重構為基於 Deep Agents 的技能庫架構,提升了靈活性和效率。
  • 新架構使開發週期縮短約 80-85%,並顯著減少了使用者確認提示。
站內正文

在LangSmith中追蹤語音代理

LangSmith現已支援對基於Pipecat、LiveKit、OpenAI Realtime和Gemini Live構建的語音代理進行追蹤。可以捕獲音訊、STT和TTS延遲、中斷、工具呼叫等資訊,並整合到一個追蹤中。

  • LangSmith推出Python整合,支援追蹤四種主流語音代理框架。
  • 語音代理需要可觀測性,包括音訊記錄、延遲分析和中斷檢測。
站內正文

IssueBench – 如何評估引擎

LangChain 構建了 IssueBench,這是一個合成基準測試,用於評估 LangSmith Engine 在代理軌跡中識別、分類和分組問題的能力。本文介紹了 IssueBench 的構成、評分方式以及構建過程中的經驗教訓。

  • IssueBench 包含 15 個任務,涉及 SRE 日誌分析、軟體工程和客戶支援三個領域。
  • 引擎需要識別問題、分配失敗類別、關聯到現有問題並分組新故障。
站內正文

構建受治理的AI代理:成本、控制與合規框架

AI代理正成為生產基礎設施的一部分,但隨之而來的是治理挑戰。本文提出了一個框架,透過LLM閘道器在執行時強制執行策略,涵蓋安全性、身份認證、審計日誌、資料隔離等基礎,並提供了三種常見切入點(可見性主導、控制主導、保證主導)。閘道器與追蹤、評估、監控系統整合,實現持續改進。

  • 治理需要執行時控制平面(LLM閘道器)來強制執行模型呼叫、工具呼叫和代理互動中的策略。
  • 基礎包括安全性、身份認證、審計日誌、使用者管理、提供商金鑰、資料分離和資料駐留。
站內正文

開源提取服務:從非結構化文本中提取結構化資料

LangChain 釋出了一個開源提取服務的託管版本,支援從 PDF、HTML 和文本檔案中提取結構化資料。該服務免費使用,但不宜用於生產環境或敏感資料。它允許使用者定義提取模式、新增少量示例,並切換不同的 LLM 模型。透過一個簡單的使用者介面,開發者可以快速實驗並整合到自己的 LangChain 工作流中。

  • LangChain 推出了一個開源結構化資料提取服務的託管版本,帶有簡單前端。
  • 支援 PDF、HTML 和文本檔案,使用者可自定義提取模式和提供少量示例。
站內正文

證明金融服務業中代理型AI的投資回報率

文章討論了金融服務業中代理型AI(Agentic AI)的ROI證明問題,指出傳統監控工具無法處理多代理系統的動態成本結構。透過兩個實際用例——RFP處理流程自動化和反洗錢合規監控,展示瞭如何利用LangChain平臺(含LangSmith和LangGraph)與Pay-i經濟智慧平臺結合,將工程級可觀測性連線到業務價值,從而向領導層證明AI投資回報。

  • 多代理系統的成本結構是動態的,傳統FinOps工具無法處理。
  • LangSmith提供工程級可觀測性,Pay-i將成本與業務成果關聯。
站內正文

OpenWiki 0.2 為程式碼庫文件引入 OKF 支援

OpenWiki 0.2 版本增加了對 OKF(一種知識 wiki 結構化標準)的支援,使開發者能夠更好地組織和分類程式碼庫文件,提升代理檢索效率並減少令牌消耗。

  • OpenWiki 0.2 支援 OKF 格式,在 wiki 檔案中新增 YAML 前置後設資料(標題、描述、標籤等)。
  • 新增 index.md 和 logs.md 檔案,分別用於目錄摘要和變更日誌。
站內正文

Fleet新功能:一鍵將AI代理部署到Slack

LangChain的Fleet平臺新增一鍵部署功能,允許使用者無需編碼即可建立併發布AI代理到Slack。代理可擁有自定義身份,在頻道和執行緒中工作,並支援許可權控制和審批流程。

  • Fleet支援用自然語言構建專業AI代理,無需程式設計。
  • 代理可一鍵部署到Slack,擁有獨立身份,團隊可識別和@提及。
站內正文

智慧體需要自己的計算機:如何安全地賦予它們

為了讓AI智慧體真正自主執行任務,它們需要一個隔離、安全且可快速部署的計算環境。本文介紹了智慧體為何需要自己的“計算機”,以及LangSmith沙箱如何透過微虛擬機器隔離、快照與分支、認證代理和安全執行等特性滿足這一需求。同時討論了提示注入等安全風險及緩解措施。

  • 智慧體需要隔離的執行環境來執行程式碼、安裝包和訪問網路,而不僅僅是生成文本。
  • LangSmith沙箱為每個智慧體提供硬體虛擬化的微虛擬機器,啟動時間低於1秒,且自動清理。
站內正文

如何使用LangSmith追蹤除錯編碼代理

使用LangSmith追蹤Claude Code、Codex、Cursor、Copilot等編碼代理。檢查工具呼叫、子代理、錯誤、成本和重試。

  • 編碼代理是黑盒;LangSmith提供跨不同代理的統一可見性。
  • 追蹤包括模型呼叫、工具呼叫、子代理、錯誤、時間和成本。
站內正文

OpenWiki Brains:AI代理的主動記憶框架

OpenWiki Brains 是 LangChain 推出的新框架,透過連線 Gmail、Notion、Git 等多種來源,為 AI 代理提供主動的 Wiki 式記憶,並自動更新本地 Wiki。

  • OpenWiki Brains 將外部資訊轉化為代理可用的本地 Wiki 記憶。
  • 支援個人大腦(Personal Brain)和程式碼大腦(Code Brain)兩種模式。
站內正文

使用Perplexity Agent API、LangGraph和LangSmith構建可審計的風險投資研究代理

瞭解如何構建一個風險投資研究代理,它能在90秒內生成帶有引用的投資備忘錄,使用Perplexity Agent API、LangGraph和LangSmith。該代理並行執行團隊、財務、產品和市場四個研究節點,然後綜合生成包含七個部分的備忘錄,包括論點與建議。每個宣告都可追溯到原始來源,確保輸出可審計。文章還比較了三個搜尋提供商,並提供了構建類似代理的要點。

  • 一個利用Perplexity Agent API、LangGraph和LangSmith構建的代理,能在約90秒內以約0.40美元的成本生成投資備忘錄草稿,每個宣告都有引用。
  • 四個並行研究節點(團隊、財務、產品、市場)收集證據,然後一個無工具的合成器撰寫備忘錄。
站內正文

LangChain與NVIDIA聯合釋出NemoClaw深度代理藍圖

LangChain與NVIDIA合作推出NemoClaw深度代理藍圖,結合LangChain深度代理程式碼、NVIDIA Nemotron 3 Ultra和OpenShell,為企業構建開放、受治理的代理系統。該藍圖在代理評估中實現了領先效能,且推理成本降低約10倍。

  • NemoClaw深度代理藍圖整合了LangChain的代理框架、NVIDIA的開放模型Nemotron 3 Ultra以及安全執行時OpenShell。
  • 該藍圖在LangChain代理評估套件中達到0.86的綜合得分,成本僅為4.48美元,相比競爭對手的43.48美元,推理成本降低約10倍。
站內正文

調校框架而非模型:Nemotron 3 Ultra實踐指南

透過僅調整Nemotron 3 Ultra的外部框架(harness),在Deep Agents基準測試中達到接近Opus 4.8的最佳成績,成本降低約10倍。本文詳細介紹了評估驅動的方法、提示工程和中介軟體最佳化,以及哪些改進無效。

  • 僅調整框架,Nemotron 3 Ultra在Deep Agents套件上達到0.86分,接近Opus 4.8的0.87分,成本降低約10倍。
  • 評估是框架工作的訓練資料:每次更改都要透過追蹤驅動迴圈,先低成本篩選,重複驗證有效才保留。
站內正文

在NVIDIA NemoClaw上執行Deep Agents Code:為最敏感程式碼設計的治理藍圖

Deep Agents Code現在可作為NVIDIA NemoClaw的治理藍圖執行,使用開放模型Nemotron 3 Ultra,提供預設拒絕網路、人工審批和完整審計日誌,適用於敏感程式碼現代化。

  • Deep Agents Code (dcode) 作為NemoClaw藍圖,執行開放模型Nemotron 3 Ultra,確保程式碼、模型和審計軌跡自主可控。
  • 預設拒絕網路、人工審批和完整審計軌跡為監管團隊提供所需控制。
站內正文

全部來源