待翻译:Managed Deep Agents is now in public beta 2026-08-08 01:24 UTC+8 AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Deploy Deep Agents to a managed LangSmith runtime with durable execution, memory, sandboxes, channels, evals, and production-ready infrastructure.
AI 服务暂时不可用,系统已先保留来源内容与降级元数据。 Deploy Deep Agents to a managed LangSmith runtime with durable execution, memory, sandboxes, channels, evals, and production-ready infrastructure. 待翻译:Deep Agents vs LangChain vs LangGraph 2026-08-07 01:55 UTC+8 AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Deep Agents, LangChain, and LangGraph each offer distinct approaches to building agents. In this post, we cover the key distinctions between our open source frameworks and when you should reach for each one.
AI 服务暂时不可用,系统已先保留来源内容与降级元数据。 Deep Agents, LangChain, and LangGraph each offer distinct approaches to building agents. In this post, we cover the key distinctions between our open source frameworks and when yo… 待翻译:How we built an autonomous SRE agent for Kubernetes 2026-08-06 00:17 UTC+8 AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Learn how LangChain built an autonomous SRE agent for Kubernetes deployments with Deep Agents, human approval for changes, LangSmith tracing, and evals.
AI 服务暂时不可用,系统已先保留来源内容与降级元数据。 Learn how LangChain built an autonomous SRE agent for Kubernetes deployments with Deep Agents, human approval for changes, LangSmith tracing, and evals. 待翻译:How to Evaluate Voice Agents with LangSmith 2026-08-05 01:15 UTC+8 AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Learn how to evaluate voice agents across execution, outcomes, and caller experience using LangSmith traces, code evaluators, LLM judges, and human review.
AI 服务暂时不可用,系统已先保留来源内容与降级元数据。 Learn how to evaluate voice agents across execution, outcomes, and caller experience using LangSmith traces, code evaluators, LLM judges, and human review. 待翻译:Customer Experience (CX) Agents in Production: Lessons from Lyft, Vodafone, and LATAM Airlines 2026-08-05 00:00 UTC+8 AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Customer Experience (CX) Agents in Production: Lessons from Lyft, Vodafone, and LATAM Airlines
AI 服务暂时不可用,系统已先保留来源内容与降级元数据。 Customer Experience (CX) Agents in Production: Lessons from Lyft, Vodafone, and LATAM Airlines 待翻译:How Stripe Built Kai on Deep Agents in 1 Week 2026-08-03 23:30 UTC+8 AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Learn how Stripe built Kai, a company-wide AI agent on LangChain, LangGraph, and Deep Agents, reaching 5,000 users in roughly 4 weeks.
AI 服务暂时不可用,系统已先保留来源内容与降级元数据。 Learn how Stripe built Kai, a company-wide AI agent on LangChain, LangGraph, and Deep Agents, reaching 5,000 users in roughly 4 weeks. 使用 ReviewBench 评估代码审查代理 2026-08-01 00:58 UTC+8 LangChain 构建了 ReviewBench,一个基于真实拉取请求反馈的基准,用于评估代码审查代理。文章介绍了从真实审查评论中筛选任务、运行方式、评分指标、初步结果以及未来方向。
ReviewBench 基于 LangSmith 仓库中受信任审查者的真实 PR 评论构建。 通过 LLM 门控和人工筛选将原始评论转化为可验证的基准任务。 LangSmith LLM网关:为生产环境中的AI代理提供运行时控制 2026-07-31 01:18 UTC+8 LangSmith LLM网关现已公开测试,为生产环境中的代理模型调用提供集中治理层,包括成本控制、速率限制、模型回退和敏感数据保护,帮助团队避免供应商锁定并有效管理模型使用。
LangSmith LLM网关作为代理与模型之间的集中治理层,提供运行时控制。 支持成本上限、速率限制、模型回退和敏感数据编辑等关键控制。 Similarweb如何使用LangSmith评估Agent报告 2026-07-29 23:30 UTC+8 了解Similarweb如何使用LangSmith通过评分标准、忠实度检查、追踪和基线比较来评估长篇Agent研究报告。
根据输出类型匹配评估方法:标准答案适用于聚焦问题,而长篇报告需要评分标准、忠实度检查和基线比较。 将分数视为信号而非答案:Similarweb使用LangSmith将每个分数与评估者评论、追踪和A/B比较关联起来。 LangChain如何构建以代理为先的数据栈 2026-07-28 13:40 UTC+8 LangChain数据团队通过集成Hex、dbt、语义模型和可观测性,构建了一个可靠的数据代理,将自助分析容量提升了40倍,同时将数据团队的角色从回答每个问题转变为改进系统。
可靠的数据代理需要清晰的模型、指标定义、业务上下文和信任信号。 代理优先的栈可将自助服务扩展40倍,处理此前三人数据团队的请求量。 掌握你的智能:实现持久AI优势的关键 2026-07-26 04:16 UTC+8 企业必须控制自己的代理系统、治理、上下文和反馈循环,才能将通用AI转化为持久的业务优势。本文阐述了为何通用AI不足以创造差异化,并提供了实现智能所有权的具体策略,包括控制模型、编排、上下文,管理成本、质量和风险,以及构建持续改进的学习循环。
通用AI无法提供持久的竞争优势,企业需要针对自身业务定制的智能。 智能所有权意味着控制代理系统的三层:模型、编排和上下文。 2026年7月:LangChain 新闻通讯 — NemoClaw 蓝图、OpenWiki Brains 等 2026-07-24 02:39 UTC+8 本期内容包括:Jensen Huang 与 Harrison 探讨开放代理系统的未来,发布 NVIDIA NemoClaw for LangChain Deep Agents 蓝图;LangSmith Sandboxes 免费试用、Fleet Slack 集成、语音追踪;开源项目 OpenWiki Brains、Deep Agents 与 Harbor 统一评估栈、RLMs 动态子代理;新课程《Deep Agents 入门》;以及多场线下活动和客户案例。
Jensen Huang 和 Harrison 强调开放代理系统的重要性,并推出 NemoClaw 蓝图。 LangSmith 推出 Sandboxes 免费试用、Slack 集成和语音追踪功能。 我们如何对深度代理进行基准测试 2026-07-24 01:55 UTC+8 深度代理的开发因评估困难而颇具挑战。我们最近改进了评估框架,利用 Harbor 在编码、对话和检索三大领域进行端到端评估,并分享了我们的实践方法。
使用 Harbor 进行端到端评估,包含环境、指令和评估脚本。 三大基准测试:Harbor-Index(自主工作)、τ³-bench(对话)、ContextBench(检索)。 评估工程技能:从仓库上下文和追踪构建评估 2026-07-23 00:57 UTC+8 LangChain 发布了评估工程技能,该技能通过检查代理的仓库结构和追踪记录,以访谈方式提出评估方案,并生成可执行的 Harbor 格式评估任务。
新技能自动分析代理仓库和追踪,提出待测试能力。 通过用户访谈迭代完善评估,而非一次性生成。 用LangGraph进行图工程:三年经验总结 2026-07-22 20:37 UTC+8 本文总结了LangChain团队三年来使用LangGraph构建代理系统的经验。图工程并非新概念,而是构建可靠代理的成熟方法。文章介绍了何时使用图、何时避免使用图,以及从实践中总结的关键教训:代理图通常不是有向无环图(DAG),循环是简单的图,动态转换很重要。
图工程是通过图表表示代理系统工作流的方法,平衡了确定性和自主性。 LangGraph自2023年推出以来,每月下载量超过6500万次,被初创企业和大型企业广泛采用。 Apollo 如何利用 Deep Agents 和 LangSmith 构建 GTM AI 2026-07-22 02:27 UTC+8 Apollo 使用 Deep Agents 和 LangSmith 驱动其 AI 助手,实现从潜在客户挖掘、信息丰富、外联、分析到 MCP 集成的完整 GTM 循环。
Apollo 将 AI 助手从监督式架构重构为基于 Deep Agents 的技能库架构,提升了灵活性和效率。 新架构使开发周期缩短约 80-85%,并显著减少了用户确认提示。 在LangSmith中追踪语音代理 2026-07-22 00:00 UTC+8 LangSmith现已支持对基于Pipecat、LiveKit、OpenAI Realtime和Gemini Live构建的语音代理进行追踪。可以捕获音频、STT和TTS延迟、中断、工具调用等信息,并整合到一个追踪中。
LangSmith推出Python集成,支持追踪四种主流语音代理框架。 语音代理需要可观测性,包括音频记录、延迟分析和中断检测。 IssueBench – 如何评估引擎 2026-07-21 01:00 UTC+8 LangChain 构建了 IssueBench,这是一个合成基准测试,用于评估 LangSmith Engine 在代理轨迹中识别、分类和分组问题的能力。本文介绍了 IssueBench 的构成、评分方式以及构建过程中的经验教训。
IssueBench 包含 15 个任务,涉及 SRE 日志分析、软件工程和客户支持三个领域。 引擎需要识别问题、分配失败类别、关联到现有问题并分组新故障。 构建受治理的AI代理:成本、控制与合规框架 2026-07-20 23:46 UTC+8 AI代理正成为生产基础设施的一部分,但随之而来的是治理挑战。本文提出了一个框架,通过LLM网关在运行时强制执行策略,涵盖安全性、身份认证、审计日志、数据隔离等基础,并提供了三种常见切入点(可见性主导、控制主导、保证主导)。网关与追踪、评估、监控系统集成,实现持续改进。
治理需要运行时控制平面(LLM网关)来强制执行模型调用、工具调用和代理交互中的策略。 基础包括安全性、身份认证、审计日志、用户管理、提供商密钥、数据分离和数据驻留。 开源提取服务:从非结构化文本中提取结构化数据 2026-07-18 09:05 UTC+8 LangChain 发布了一个开源提取服务的托管版本,支持从 PDF、HTML 和文本文件中提取结构化数据。该服务免费使用,但不宜用于生产环境或敏感数据。它允许用户定义提取模式、添加少量示例,并切换不同的 LLM 模型。通过一个简单的用户界面,开发者可以快速实验并集成到自己的 LangChain 工作流中。
LangChain 推出了一个开源结构化数据提取服务的托管版本,带有简单前端。 支持 PDF、HTML 和文本文件,用户可自定义提取模式和提供少量示例。 证明金融服务业中代理型AI的投资回报率 2026-07-18 02:55 UTC+8 文章讨论了金融服务业中代理型AI(Agentic AI)的ROI证明问题,指出传统监控工具无法处理多代理系统的动态成本结构。通过两个实际用例——RFP处理流程自动化和反洗钱合规监控,展示了如何利用LangChain平台(含LangSmith和LangGraph)与Pay-i经济智能平台结合,将工程级可观测性连接到业务价值,从而向领导层证明AI投资回报。
多代理系统的成本结构是动态的,传统FinOps工具无法处理。 LangSmith提供工程级可观测性,Pay-i将成本与业务成果关联。 OpenWiki 0.2 为代码库文档引入 OKF 支持 2026-07-17 00:52 UTC+8 OpenWiki 0.2 版本增加了对 OKF(一种知识 wiki 结构化标准)的支持,使开发者能够更好地组织和分类代码库文档,提升代理检索效率并减少令牌消耗。
OpenWiki 0.2 支持 OKF 格式,在 wiki 文件中添加 YAML 前置元数据(标题、描述、标签等)。 新增 index.md 和 logs.md 文件,分别用于目录摘要和变更日志。 Fleet新功能:一键将AI代理部署到Slack 2026-07-16 00:31 UTC+8 LangChain的Fleet平台新增一键部署功能,允许用户无需编码即可创建并发布AI代理到Slack。代理可拥有自定义身份,在频道和线程中工作,并支持权限控制和审批流程。
Fleet支持用自然语言构建专业AI代理,无需编程。 代理可一键部署到Slack,拥有独立身份,团队可识别和@提及。 智能体需要自己的计算机:如何安全地赋予它们 2026-07-15 22:40 UTC+8 为了让AI智能体真正自主执行任务,它们需要一个隔离、安全且可快速部署的计算环境。本文介绍了智能体为何需要自己的“计算机”,以及LangSmith沙箱如何通过微虚拟机隔离、快照与分支、认证代理和安全执行等特性满足这一需求。同时讨论了提示注入等安全风险及缓解措施。
智能体需要隔离的执行环境来运行代码、安装包和访问网络,而不仅仅是生成文本。 LangSmith沙箱为每个智能体提供硬件虚拟化的微虚拟机,启动时间低于1秒,且自动清理。 如何使用LangSmith追踪调试编码代理 2026-07-15 00:05 UTC+8 使用LangSmith追踪Claude Code、Codex、Cursor、Copilot等编码代理。检查工具调用、子代理、错误、成本和重试。
编码代理是黑盒;LangSmith提供跨不同代理的统一可见性。 追踪包括模型调用、工具调用、子代理、错误、时间和成本。 OpenWiki Brains:AI代理的主动记忆框架 2026-07-11 00:46 UTC+8 OpenWiki Brains 是 LangChain 推出的新框架,通过连接 Gmail、Notion、Git 等多种来源,为 AI 代理提供主动的 Wiki 式记忆,并自动更新本地 Wiki。
OpenWiki Brains 将外部信息转化为代理可用的本地 Wiki 记忆。 支持个人大脑(Personal Brain)和代码大脑(Code Brain)两种模式。 使用Perplexity Agent API、LangGraph和LangSmith构建可审计的风险投资研究代理 2026-07-09 23:58 UTC+8 了解如何构建一个风险投资研究代理,它能在90秒内生成带有引用的投资备忘录,使用Perplexity Agent API、LangGraph和LangSmith。该代理并行运行团队、财务、产品和市场四个研究节点,然后综合生成包含七个部分的备忘录,包括论点与建议。每个声明都可追溯到原始来源,确保输出可审计。文章还比较了三个搜索提供商,并提供了构建类似代理的要点。
一个利用Perplexity Agent API、LangGraph和LangSmith构建的代理,能在约90秒内以约0.40美元的成本生成投资备忘录草稿,每个声明都有引用。 四个并行研究节点(团队、财务、产品、市场)收集证据,然后一个无工具的合成器撰写备忘录。 LangChain与NVIDIA联合发布NemoClaw深度代理蓝图 2026-07-08 23:04 UTC+8 LangChain与NVIDIA合作推出NemoClaw深度代理蓝图,结合LangChain深度代理代码、NVIDIA Nemotron 3 Ultra和OpenShell,为企业构建开放、受治理的代理系统。该蓝图在代理评估中实现了领先性能,且推理成本降低约10倍。
NemoClaw深度代理蓝图整合了LangChain的代理框架、NVIDIA的开放模型Nemotron 3 Ultra以及安全运行时OpenShell。 该蓝图在LangChain代理评估套件中达到0.86的综合得分,成本仅为4.48美元,相比竞争对手的43.48美元,推理成本降低约10倍。 调校框架而非模型:Nemotron 3 Ultra实践指南 2026-07-08 23:00 UTC+8 通过仅调整Nemotron 3 Ultra的外部框架(harness),在Deep Agents基准测试中达到接近Opus 4.8的最佳成绩,成本降低约10倍。本文详细介绍了评估驱动的方法、提示工程和中间件优化,以及哪些改进无效。
仅调整框架,Nemotron 3 Ultra在Deep Agents套件上达到0.86分,接近Opus 4.8的0.87分,成本降低约10倍。 评估是框架工作的训练数据:每次更改都要通过追踪驱动循环,先低成本筛选,重复验证有效才保留。 在NVIDIA NemoClaw上运行Deep Agents Code:为最敏感代码设计的治理蓝图 2026-07-08 23:00 UTC+8 Deep Agents Code现在可作为NVIDIA NemoClaw的治理蓝图运行,使用开放模型Nemotron 3 Ultra,提供默认拒绝网络、人工审批和完整审计日志,适用于敏感代码现代化。
Deep Agents Code (dcode) 作为NemoClaw蓝图,运行开放模型Nemotron 3 Ultra,确保代码、模型和审计轨迹自主可控。 默认拒绝网络、人工审批和完整审计轨迹为监管团队提供所需控制。