使用 ReviewBench 评估代码审查代理
LangChain 构建了 ReviewBench,一个基于真实拉取请求反馈的基准,用于评估代码审查代理。文章介绍了从真实审查评论中筛选任务、运行方式、评分指标、初步结果以及未来方向。
- ReviewBench 基于 LangSmith 仓库中受信任审查者的真实 PR 评论构建。
- 通过 LLM 门控和人工筛选将原始评论转化为可验证的基准任务。
长尾标签
跟踪 Agent 框架、编排、记忆、评测、工作流自动化和生产部署。
LangChain 构建了 ReviewBench,一个基于真实拉取请求反馈的基准,用于评估代码审查代理。文章介绍了从真实审查评论中筛选任务、运行方式、评分指标、初步结果以及未来方向。
语音代理的真正难点不是语音识别、大模型和语音合成三件套的简单拼接,而是流式编排:流式语音识别、话轮检测、流式生成、打断处理以及语音约束下的工具调用。本文逐一拆解各环节的职责与易错点,并给出无需付费 API 即可运行的代码示例。
Google DeepMind发布了Gemini Robotics 2,这是其下一代机器人的智能层。该版本包含三个模型:用于全身人形控制的视觉-语言-动作模型(VLA)、用于具身推理和任务编排的Gemini Robotics ER 2,以及可快速适应新机器人本体的设备端VLA。一个检查点可驱动Apptronik Apollo 2和Franka Duo。仅ER 2公开可用。
LangSmith LLM网关现已公开测试,为生产环境中的代理模型调用提供集中治理层,包括成本控制、速率限制、模型回退和敏感数据保护,帮助团队避免供应商锁定并有效管理模型使用。
了解Similarweb如何使用LangSmith通过评分标准、忠实度检查、追踪和基线比较来评估长篇Agent研究报告。
Perplexity推出了SPACE沙箱平台,用于其Computer AI智能体,重点在于状态管理而非仅仅隔离。该平台基于Firecracker微虚拟机、Kubernetes和Btrfs文件系统,实现高效快照、暂停/恢复和分支。SPACE比现有方案快3倍,每分钟快照一次,可回滚一周。安全功能包括RBAC、即时访问和逐工具控制。未来计划提供API产品、支持第三方沙箱和本地/混合部署。Perplexity还引入了一种低成本编排器模型。
作者独自参加2026年ICFP编程竞赛,全程仅使用AI(Fable),最终在约200支队伍中排名前25左右。文章反思了AI的优缺点、测试和编排的重要性,以及AI上下文丢失的挑战。
本文展示了如何使用LangGraph和Strands在Amazon Bedrock AgentCore上构建生产级的多智能体AI系统。以市场监控为例,详细说明了状态驱动的工作流编排、基于检查点的恢复机制以及AgentCore的内存和可观测性功能。
Diagrid 发布 Catalyst 2.0,为基于 LangGraph、Microsoft Agent Framework 等框架构建的 AI 代理添加持久执行和证明层,使其在中断后能从最后一步恢复,并提供不可篡改的执行记录,适用于金融、医疗等受监管行业。
LangChain数据团队通过集成Hex、dbt、语义模型和可观测性,构建了一个可靠的数据代理,将自助分析容量提升了40倍,同时将数据团队的角色从回答每个问题转变为改进系统。
研究人员提出了一种名为Pigey的物理代理编排器,它将机器人能力分解为高层管理器和低层策略,在LIBERO-PRO上实现了超过4倍的性能提升,在真实世界的推理任务中取得了接近100%的成功率。
Hydra是一个本地优先的AI编排命令行工具,它通过置信度路由和最优停止算法,在降低成本的同时保证质量。与云端网关不同,Hydra在本地运行,支持离线操作,并具有问责账本功能。
Sakana AI 发布了 Fugu-Cyber,这是其 Fugu 编排模型的安全专用端点。报告显示在 CyberGym 和 CTI-REALM 上的成功率分别为 86.9% 和 72.1%,略高于 GPT-5.5-Cyber 和 Claude Mythos Preview。访问需经手动审批、防御使用策略和代币计划。
企业必须控制自己的代理系统、治理、上下文和反馈循环,才能将通用AI转化为持久的业务优势。本文阐述了为何通用AI不足以创造差异化,并提供了实现智能所有权的具体策略,包括控制模型、编排、上下文,管理成本、质量和风险,以及构建持续改进的学习循环。
SHACKLE是一个开源的运行时治理层,实时仲裁每个代理工具调用,给出ALLOW/DENY/HITL判决。它包含SP/1.0一致性标准,提供15个哈希可验证的测试向量,并设有认证级别。与LiteLLM和AutoGen集成,防止失控循环和预算超支。
本文深入探讨了构建可靠的代理型AI系统所需的五个核心工程概念:通过MCP协议的工具使用、记忆与上下文工程、规划与推理循环、多代理编排以及评估与防护措施。文章解释了为什么大部分AI代理无法投入生产,以及如何构建稳健的系统。
Kolega Code 是一个本地优先的终端编码代理,支持多代理编排(Gigacode),适用于大规模代码审查、迁移等任务。它允许多个专业子代理并行工作,支持多种模型提供商和路由,具备计划与构建模式,以及丰富的工具集。
本文提出AINTMA(智能体智能测试管理架构),这是一个多智能体AI系统,旨在将传统测试管理转变为自主质量智能生态系统。该系统部署了六个专门的人工智能代理(测试发现、风险评估、强化学习优先级排序、执行编排、生成式质量智能和云安全监控),通过安全的云原生微服务基础设施进行协调。评估表明,在12个异构软件项目上,测试优先级排序准确率达88.4%,测试周期时间减少43%,缺陷逃逸率从8.3%降至2.1%,9个月投资回报率达340%。
Bohay 是一个开源终端工具,为多个AI编码代理提供统一的监控和管理界面,包括代理状态跟踪、会话持久化、编排协作、Git集成、远程SSH支持以及macOS刘海面板。
Kalytera是一款面向生产环境的AI代理评估工具,能够自动捕获每个步骤的失败、用通俗英语指出根本原因,并发现重复出现的失败模式。它提供100%流量覆盖,支持LangChain、CrewAI等框架,免费层每月可评估10,000次会话。
本期内容包括:Jensen Huang 与 Harrison 探讨开放代理系统的未来,发布 NVIDIA NemoClaw for LangChain Deep Agents 蓝图;LangSmith Sandboxes 免费试用、Fleet Slack 集成、语音追踪;开源项目 OpenWiki Brains、Deep Agents 与 Harbor 统一评估栈、RLMs 动态子代理;新课程《Deep Agents 入门》;以及多场线下活动和客户案例。
深度代理的开发因评估困难而颇具挑战。我们最近改进了评估框架,利用 Harbor 在编码、对话和检索三大领域进行端到端评估,并分享了我们的实践方法。
Motorway与AWS合作构建了端到端评估管道,将错误结果从每8次查询1次减少到每50次1次,并将问题检测时间从几小时缩短到几分钟。该管道结合了Strands Agents SDK与Amazon Bedrock AgentCore,本文介绍了如何为您的代理构建此管道。
AgentNest 是一个开源运行时,用于在安全、可丢弃的沙箱中执行 AI 代理代码。它支持 Python、shell 命令、文件、包、浏览器、GPU 和 Git,具有精细的网络策略、有状态的会话和可分支状态。自托管且可扩展,与 LangChain、MCP 等集成。
本文介绍了Databricks如何利用Lakebase Postgres为AI代理构建一个可扩展、容错的任务队列,无需外部中间件。通过四个Postgres原生模式,实现了并发优先级感知的调度、基于租约的崩溃恢复、速率限制感知的节流以及幂等回调。同时,结合LISTEN/NOTIFY和SSE实现了实时操作仪表板。该架构已在CLA的审计解决方案中得到验证,将文档提取时间从数小时缩短至数分钟。
AI Maestro是一个开源工具,通过将软件交付流程编排为AI代理团队而非单一对话,实现对任务板的智能管理。它支持基于任务板的票证路由、隔离的Git工作树、可复用的技能库以及可视化控制台,旨在提升多代理协作效率。
LangChain 发布了评估工程技能,该技能通过检查代理的仓库结构和追踪记录,以访谈方式提出评估方案,并生成可执行的 Harbor 格式评估任务。
本文总结了LangChain团队三年来使用LangGraph构建代理系统的经验。图工程并非新概念,而是构建可靠代理的成熟方法。文章介绍了何时使用图、何时避免使用图,以及从实践中总结的关键教训:代理图通常不是有向无环图(DAG),循环是简单的图,动态转换很重要。
Apollo 使用 Deep Agents 和 LangSmith 驱动其 AI 助手,实现从潜在客户挖掘、信息丰富、外联、分析到 MCP 集成的完整 GTM 循环。
LangSmith现已支持对基于Pipecat、LiveKit、OpenAI Realtime和Gemini Live构建的语音代理进行追踪。可以捕获音频、STT和TTS延迟、中断、工具调用等信息,并整合到一个追踪中。
到2026年中,自主AI架构已演进,原生推理模型取代了编排循环,多智能体蜂群和通过MCP标准化的工具协议成为主流。本文涵盖如何设计无状态专业智能体、记忆图和安全模式。
AskCodi是一种AI工具,旨在大规模编排智能体同时降低成本。
Open-Kritt 是一个开源、自托管的 AI 安全研究平台,通过编排 AI 代理并行执行细化任务,帮助安全研究人员和开发者高效发现代码漏洞。项目团队此前在漏洞悬赏中累计获得超过150万美元奖金。
LangChain 构建了 IssueBench,这是一个合成基准测试,用于评估 LangSmith Engine 在代理轨迹中识别、分类和分组问题的能力。本文介绍了 IssueBench 的构成、评分方式以及构建过程中的经验教训。
AI代理正成为生产基础设施的一部分,但随之而来的是治理挑战。本文提出了一个框架,通过LLM网关在运行时强制执行策略,涵盖安全性、身份认证、审计日志、数据隔离等基础,并提供了三种常见切入点(可见性主导、控制主导、保证主导)。网关与追踪、评估、监控系统集成,实现持续改进。
本周精选包括如何用注册表模式替代If-Else链、降低LLM延迟和推理成本的12种方法、五个真实SQL项目构建数据作品集、Git Worktrees用于AI开发、用Outlines进行结构化语言模型生成、七个用于编排本地AI代理的Python框架、10个保持AI前沿的YouTube频道、Conductor for Gemini CLI入门、五个免费资源学习Agentic AI以及Pi编码代理的工作方式。
Google Cloud 的生成式 AI 存储库发布了一个参考实现——Always-On Memory Agent,它将记忆视为一个持续运行的进程。该系统基于 Google ADK 和 Gemini 3.1 Flash-Lite,不使用向量数据库或嵌入,而是通过编排器将请求路由到摄取、整合和查询子代理,这些代理持续地读取、连接和将结构化记忆写入 SQLite。
LangChain 发布了一个开源提取服务的托管版本,支持从 PDF、HTML 和文本文件中提取结构化数据。该服务免费使用,但不宜用于生产环境或敏感数据。它允许用户定义提取模式、添加少量示例,并切换不同的 LLM 模型。通过一个简单的用户界面,开发者可以快速实验并集成到自己的 LangChain 工作流中。
文章讨论了金融服务业中代理型AI(Agentic AI)的ROI证明问题,指出传统监控工具无法处理多代理系统的动态成本结构。通过两个实际用例——RFP处理流程自动化和反洗钱合规监控,展示了如何利用LangChain平台(含LangSmith和LangGraph)与Pay-i经济智能平台结合,将工程级可观测性连接到业务价值,从而向领导层证明AI投资回报。
Athena是Shoplazza推出的AI编排代理,旨在统一管理整个商业技术栈,简化电商运营流程。
OpenWiki 0.2 版本增加了对 OKF(一种知识 wiki 结构化标准)的支持,使开发者能够更好地组织和分类代码库文档,提升代理检索效率并减少令牌消耗。
Democr.ai 是一个开源的自托管代理AI运行时框架,集成了服务器驱动UI、多客户端渲染、多租户、RBAC、OS级沙箱、三层审计、可插拔AI引擎编排、知识子系统等核心功能。其核心理念是“一切皆模块”,无供应商锁定,强调安全作为原语。项目仍处于测试阶段,但架构已面向生产级约束。
Cybara 是一个自托管的 AI 代理操作系统,结合了 Bun 代理运行时、Web UI、CLI、桌面应用、移动伴侣、加密钱包控制、多平台消息通道适配器和 MCP 支持。它支持多代理编排、浏览器自动化、安全消息传递和加密钱包操作,适合开发者和运营商。
根据VentureBeat Pulse Research对101家企业的调查,企业代理编排正在向模型提供商平台集中,Anthropic的Claude以40%的使用率领先。然而,大多数部署的“代理”仍是简单的聊天机器人包装,真正的多步骤编排工作流仅占少数。企业预计到2026年底采用混合控制平面以避免供应商锁定,但实时成本控制仍不成熟。
LangChain的Fleet平台新增一键部署功能,允许用户无需编码即可创建并发布AI代理到Slack。代理可拥有自定义身份,在频道和线程中工作,并支持权限控制和审批流程。
Atlassian 宣布扩展 Jira,新增 Jira Planner、Jira Coding Agent 及第三方代理集成,旨在将 Jira 打造为开发者与 AI 代理协同工作的控制平台,解决规划与协调瓶颈问题。
为了让AI智能体真正自主执行任务,它们需要一个隔离、安全且可快速部署的计算环境。本文介绍了智能体为何需要自己的“计算机”,以及LangSmith沙箱如何通过微虚拟机隔离、快照与分支、认证代理和安全执行等特性满足这一需求。同时讨论了提示注入等安全风险及缓解措施。
本文介绍了七种Python工具,工程师在2026年实际使用它们来在本地基础设施上构建、协调和运行AI代理,涵盖从模型运行到决策编排的各个层面。
TormentNexus是一个本地优先的开源AI控制平面,为多代理工作流提供持久记忆、MCP工具编排和自主基础设施管理。它支持38+ AI编码代理,具有渐进式工具路由、双层记忆架构和群集协调等功能。
本文介绍了一个基于Strands Agents和Amazon Bedrock AgentCore构建的多智能体系统,用于自动化从潜在客户发现到个性化邮件生成的流程。文章比较了Swarm和Graph两种编排模式,通过头对头基准测试评估延迟、成本和邮件质量。系统使用四个专门智能体、加权评分和时态衰减,并提供了生产部署的治理控制。
跟踪 AI 编程助手、代码生成、IDE 插件、开发者工作流和软件工程自动化。
跟踪 Model Context Protocol、工具调用、连接器、Agent 上下文和企业集成。
跟踪开源权重模型、开放许可、社区评测、模型蒸馏和本地部署。
跟踪推理价格、延迟、吞吐、缓存、量化、服务商成本和部署效率。
跟踪中国 AI 公司、模型、政策、芯片生态、开源社区和商业化进展。
跟踪 GPU、数据中心、集群网络、AI 云、训练基础设施和供应链。
跟踪模型 API 价格、套餐、上下文窗口、免费额度、单位 token 成本和商业模式。
跟踪 DeepSeek 模型、API、开源权重、推理效率、生态合作和全球影响。
跟踪 Qwen/通义千问模型、开源权重、多模态、Agent 能力、API 和企业落地。