AI News HubLIVE

Agent 框架动态

使用 ReviewBench 评估代码审查代理

LangChain 构建了 ReviewBench,一个基于真实拉取请求反馈的基准,用于评估代码审查代理。文章介绍了从真实审查评论中筛选任务、运行方式、评分指标、初步结果以及未来方向。

  • ReviewBench 基于 LangSmith 仓库中受信任审查者的真实 PR 评论构建。
  • 通过 LLM 门控和人工筛选将原始评论转化为可验证的基准任务。
站内正文

构建语音控制型AI代理

语音代理的真正难点不是语音识别、大模型和语音合成三件套的简单拼接,而是流式编排:流式语音识别、话轮检测、流式生成、打断处理以及语音约束下的工具调用。本文逐一拆解各环节的职责与易错点,并给出无需付费 API 即可运行的代码示例。

  • 顺序式“STT→LLM→TTS”流水线延迟过高,流式处理才是生产级语音代理的标准。
  • 人类对话的自然间隔约 200–300ms;超过 500ms 会明显迟缓,超过 3 秒用户往往挂断。
站内正文

Google DeepMind发布三款实体AI模型,实现全身控制、灵巧操作与多机器人协作

Google DeepMind发布了Gemini Robotics 2,这是其下一代机器人的智能层。该版本包含三个模型:用于全身人形控制的视觉-语言-动作模型(VLA)、用于具身推理和任务编排的Gemini Robotics ER 2,以及可快速适应新机器人本体的设备端VLA。一个检查点可驱动Apptronik Apollo 2和Franka Duo。仅ER 2公开可用。

  • 三款模型同时发布:VLA、具身推理VLM和设备端VLA。
  • 一个检查点驱动Apollo 2(两种手部)和Franka Duo夹爪。
站内正文

LangSmith LLM网关:为生产环境中的AI代理提供运行时控制

LangSmith LLM网关现已公开测试,为生产环境中的代理模型调用提供集中治理层,包括成本控制、速率限制、模型回退和敏感数据保护,帮助团队避免供应商锁定并有效管理模型使用。

  • LangSmith LLM网关作为代理与模型之间的集中治理层,提供运行时控制。
  • 支持成本上限、速率限制、模型回退和敏感数据编辑等关键控制。
站内正文

Similarweb如何使用LangSmith评估Agent报告

了解Similarweb如何使用LangSmith通过评分标准、忠实度检查、追踪和基线比较来评估长篇Agent研究报告。

  • 根据输出类型匹配评估方法:标准答案适用于聚焦问题,而长篇报告需要评分标准、忠实度检查和基线比较。
  • 将分数视为信号而非答案:Similarweb使用LangSmith将每个分数与评估者评论、追踪和A/B比较关联起来。
站内正文

“有状态系统极难构建”:Perplexity对AI智能体沙箱的思考

Perplexity推出了SPACE沙箱平台,用于其Computer AI智能体,重点在于状态管理而非仅仅隔离。该平台基于Firecracker微虚拟机、Kubernetes和Btrfs文件系统,实现高效快照、暂停/恢复和分支。SPACE比现有方案快3倍,每分钟快照一次,可回滚一周。安全功能包括RBAC、即时访问和逐工具控制。未来计划提供API产品、支持第三方沙箱和本地/混合部署。Perplexity还引入了一种低成本编排器模型。

  • Perplexity的SPACE沙箱平台优先考虑状态管理(暂停/恢复/分支)而非隔离。
  • 使用Firecracker微虚拟机、Kubernetes和Btrfs写时复制文件系统提高性能。
站内正文

在AI免疫竞赛中与AI合作取得还不错的结果

作者独自参加2026年ICFP编程竞赛,全程仅使用AI(Fable),最终在约200支队伍中排名前25左右。文章反思了AI的优缺点、测试和编排的重要性,以及AI上下文丢失的挑战。

  • 仅使用AI(Fable)参加2026年ICFP编程竞赛,本人未写任何代码。
  • 在约200支队伍中排名前25左右。
站内正文

使用LangGraph和Strands在AgentCore上构建市场监控智能体

本文展示了如何使用LangGraph和Strands在Amazon Bedrock AgentCore上构建生产级的多智能体AI系统。以市场监控为例,详细说明了状态驱动的工作流编排、基于检查点的恢复机制以及AgentCore的内存和可观测性功能。

  • LangGraph负责宏观工作流编排,支持状态管理和检查点恢复
  • Strands提供模型无关的智能推理,集成多种LLM和工具
站内正文

Diagrid 为失败的AI代理提供恢复方法

Diagrid 发布 Catalyst 2.0,为基于 LangGraph、Microsoft Agent Framework 等框架构建的 AI 代理添加持久执行和证明层,使其在中断后能从最后一步恢复,并提供不可篡改的执行记录,适用于金融、医疗等受监管行业。

  • Catalyst 2.0 为 AI 代理提供持久执行,支持中断后从最后一步恢复,无需从头重试。
  • 该工具基于开源 Dapr 项目,可拦截主流代理框架的执行循环,将操作注册为工作流步骤。
站内正文

LangChain如何构建以代理为先的数据栈

LangChain数据团队通过集成Hex、dbt、语义模型和可观测性,构建了一个可靠的数据代理,将自助分析容量提升了40倍,同时将数据团队的角色从回答每个问题转变为改进系统。

  • 可靠的数据代理需要清晰的模型、指标定义、业务上下文和信任信号。
  • 代理优先的栈可将自助服务扩展40倍,处理此前三人数据团队的请求量。
站内正文

通过物理代理解决通用机器人中的编排鸿沟

研究人员提出了一种名为Pigey的物理代理编排器,它将机器人能力分解为高层管理器和低层策略,在LIBERO-PRO上实现了超过4倍的性能提升,在真实世界的推理任务中取得了接近100%的成功率。

  • Pigey将高层规划与低层控制分离,无需大规模预训练。
  • 该编排器形成闭环,能够进行目标分解、命令执行、结果验证和故障恢复。
站内正文

Hydra:一个本地优先的信任控制平面,根据置信度路由AI请求

Hydra是一个本地优先的AI编排命令行工具,它通过置信度路由和最优停止算法,在降低成本的同时保证质量。与云端网关不同,Hydra在本地运行,支持离线操作,并具有问责账本功能。

  • Hydra是首个本地优先的信任控制平面,路由AI请求时基于置信度而非简单成本。
  • 它使用成本/质量帕累托前沿、顺序概率比检验(SPRT)和渗透理论来优化路由。
站内正文

Sakana AI 发布 Fugu-Cyber:编排模型在 CyberGym 上报告 86.9%,在 CTI-REALM 上报告 72.1%

Sakana AI 发布了 Fugu-Cyber,这是其 Fugu 编排模型的安全专用端点。报告显示在 CyberGym 和 CTI-REALM 上的成功率分别为 86.9% 和 72.1%,略高于 GPT-5.5-Cyber 和 Claude Mythos Preview。访问需经手动审批、防御使用策略和代币计划。

  • Fugu-Cyber 是编排端点,而非新前沿模型,于 2026 年 7 月 21 日推出。
  • Sakana 报告 CyberGym 86.9% 和 CTI-REALM 72.1%,均为自报且未复现。
站内正文

掌握你的智能:实现持久AI优势的关键

企业必须控制自己的代理系统、治理、上下文和反馈循环,才能将通用AI转化为持久的业务优势。本文阐述了为何通用AI不足以创造差异化,并提供了实现智能所有权的具体策略,包括控制模型、编排、上下文,管理成本、质量和风险,以及构建持续改进的学习循环。

  • 通用AI无法提供持久的竞争优势,企业需要针对自身业务定制的智能。
  • 智能所有权意味着控制代理系统的三层:模型、编排和上下文。
站内正文

Shackle:AI代理的预执行ALLOW/DENY/HITL门控(开源)

SHACKLE是一个开源的运行时治理层,实时仲裁每个代理工具调用,给出ALLOW/DENY/HITL判决。它包含SP/1.0一致性标准,提供15个哈希可验证的测试向量,并设有认证级别。与LiteLLM和AutoGen集成,防止失控循环和预算超支。

  • SHACKLE为AI代理工具调用提供断路器,三种判决:允许、拒绝、人工介入。
  • 实施SP/1.0一致性标准,具有可验证的测试夹具。
站内正文

每位工程师必须理解的代理型人工智能五大关键概念

本文深入探讨了构建可靠的代理型AI系统所需的五个核心工程概念:通过MCP协议的工具使用、记忆与上下文工程、规划与推理循环、多代理编排以及评估与防护措施。文章解释了为什么大部分AI代理无法投入生产,以及如何构建稳健的系统。

  • 使用模型上下文协议(MCP)标准化工具调用,让代理无需自定义集成即可与外部服务交互。
  • 记忆作为独立于上下文窗口的架构组件,借助Mem0、Zep等工具实现精准检索。
站内正文

前沿模型定价太坑,我开发了一个开源CLI工具

Kolega Code 是一个本地优先的终端编码代理,支持多代理编排(Gigacode),适用于大规模代码审查、迁移等任务。它允许多个专业子代理并行工作,支持多种模型提供商和路由,具备计划与构建模式,以及丰富的工具集。

  • Kolega Code 是一个开源的本地优先终端编码代理,支持多代理协作。
  • 通过 Gigacode 功能,可并行执行多个子任务,提升大型代码库的处理效率。
站内正文

AINTMA:面向自主测试管理的智能体AI架构,融合生成式智能、安全云通信与自适应质量分析

本文提出AINTMA(智能体智能测试管理架构),这是一个多智能体AI系统,旨在将传统测试管理转变为自主质量智能生态系统。该系统部署了六个专门的人工智能代理(测试发现、风险评估、强化学习优先级排序、执行编排、生成式质量智能和云安全监控),通过安全的云原生微服务基础设施进行协调。评估表明,在12个异构软件项目上,测试优先级排序准确率达88.4%,测试周期时间减少43%,缺陷逃逸率从8.3%降至2.1%,9个月投资回报率达340%。

  • AINTMA是一个多智能体AI系统,包含六个专门代理,用于自主测试管理。
  • 生成式质量智能代理利用大语言模型生成自然语言质量报告和测试建议。
站内正文

Show HN:Bohay – AI编码代理的指挥中心

Bohay 是一个开源终端工具,为多个AI编码代理提供统一的监控和管理界面,包括代理状态跟踪、会话持久化、编排协作、Git集成、远程SSH支持以及macOS刘海面板。

  • Bohay 提供单一终端视图实时监控AI代理(Claude、Copilot、Codex等)的状态。
  • 支持会话持久化,重启后代理自动恢复历史记录。
站内正文

Kalytera:不仅告诉你AI代理失败,还告诉你失败原因

Kalytera是一款面向生产环境的AI代理评估工具,能够自动捕获每个步骤的失败、用通俗英语指出根本原因,并发现重复出现的失败模式。它提供100%流量覆盖,支持LangChain、CrewAI等框架,免费层每月可评估10,000次会话。

  • 对代理的每个步骤进行四维评分:准确性、目标对齐、决策质量、完整性
  • 自动识别失败模式并按频率排名,给出可操作的修复建议
站内正文

2026年7月:LangChain 新闻通讯 — NemoClaw 蓝图、OpenWiki Brains 等

本期内容包括:Jensen Huang 与 Harrison 探讨开放代理系统的未来,发布 NVIDIA NemoClaw for LangChain Deep Agents 蓝图;LangSmith Sandboxes 免费试用、Fleet Slack 集成、语音追踪;开源项目 OpenWiki Brains、Deep Agents 与 Harbor 统一评估栈、RLMs 动态子代理;新课程《Deep Agents 入门》;以及多场线下活动和客户案例。

  • Jensen Huang 和 Harrison 强调开放代理系统的重要性,并推出 NemoClaw 蓝图。
  • LangSmith 推出 Sandboxes 免费试用、Slack 集成和语音追踪功能。
站内正文

我们如何对深度代理进行基准测试

深度代理的开发因评估困难而颇具挑战。我们最近改进了评估框架,利用 Harbor 在编码、对话和检索三大领域进行端到端评估,并分享了我们的实践方法。

  • 使用 Harbor 进行端到端评估,包含环境、指令和评估脚本。
  • 三大基准测试:Harbor-Index(自主工作)、τ³-bench(对话)、ContextBench(检索)。
站内正文

评估AI代理:使用Strands和AgentCore的生产蓝图

Motorway与AWS合作构建了端到端评估管道,将错误结果从每8次查询1次减少到每50次1次,并将问题检测时间从几小时缩短到几分钟。该管道结合了Strands Agents SDK与Amazon Bedrock AgentCore,本文介绍了如何为您的代理构建此管道。

  • Motorway与AWS合作构建AI驱动的经销商库存搜索代理,将自然语言查询转化为搜索结果。
  • 两阶段评估策略:构建时测试(strands-agents-evals)和生产监控(Amazon Bedrock AgentCore Evaluations)。
站内正文

展示 HN:AgentNest —— AI 代理的自托管沙箱

AgentNest 是一个开源运行时,用于在安全、可丢弃的沙箱中执行 AI 代理代码。它支持 Python、shell 命令、文件、包、浏览器、GPU 和 Git,具有精细的网络策略、有状态的会话和可分支状态。自托管且可扩展,与 LangChain、MCP 等集成。

  • 自托管沙箱,具有安全默认和出口白名单
  • 有状态的 Python 会话和可分支沙箱,适合代理工作流
站内正文

使用Lakebase Postgres简化AI代理编排

本文介绍了Databricks如何利用Lakebase Postgres为AI代理构建一个可扩展、容错的任务队列,无需外部中间件。通过四个Postgres原生模式,实现了并发优先级感知的调度、基于租约的崩溃恢复、速率限制感知的节流以及幂等回调。同时,结合LISTEN/NOTIFY和SSE实现了实时操作仪表板。该架构已在CLA的审计解决方案中得到验证,将文档提取时间从数小时缩短至数分钟。

  • Lakebase Postgres作为单一存储后端,替代了传统架构中的消息队列、调度器和缓存层。
  • 通过FOR UPDATE SKIP LOCKED实现并发安全且优先级感知的任务出队。
站内正文

AI Maestro:指挥AI编程代理团队处理任务板

AI Maestro是一个开源工具,通过将软件交付流程编排为AI代理团队而非单一对话,实现对任务板的智能管理。它支持基于任务板的票证路由、隔离的Git工作树、可复用的技能库以及可视化控制台,旨在提升多代理协作效率。

  • 任务板作为唯一真相源,工作状态在上下文重置和并行会话中不会丢失。
  • 每个票证指定代理流水线和模型,实现任务与模型的精准匹配。
站内正文

评估工程技能:从仓库上下文和追踪构建评估

LangChain 发布了评估工程技能,该技能通过检查代理的仓库结构和追踪记录,以访谈方式提出评估方案,并生成可执行的 Harbor 格式评估任务。

  • 新技能自动分析代理仓库和追踪,提出待测试能力。
  • 通过用户访谈迭代完善评估,而非一次性生成。
站内正文

用LangGraph进行图工程:三年经验总结

本文总结了LangChain团队三年来使用LangGraph构建代理系统的经验。图工程并非新概念,而是构建可靠代理的成熟方法。文章介绍了何时使用图、何时避免使用图,以及从实践中总结的关键教训:代理图通常不是有向无环图(DAG),循环是简单的图,动态转换很重要。

  • 图工程是通过图表表示代理系统工作流的方法,平衡了确定性和自主性。
  • LangGraph自2023年推出以来,每月下载量超过6500万次,被初创企业和大型企业广泛采用。
站内正文

Apollo 如何利用 Deep Agents 和 LangSmith 构建 GTM AI

Apollo 使用 Deep Agents 和 LangSmith 驱动其 AI 助手,实现从潜在客户挖掘、信息丰富、外联、分析到 MCP 集成的完整 GTM 循环。

  • Apollo 将 AI 助手从监督式架构重构为基于 Deep Agents 的技能库架构,提升了灵活性和效率。
  • 新架构使开发周期缩短约 80-85%,并显著减少了用户确认提示。
站内正文

在LangSmith中追踪语音代理

LangSmith现已支持对基于Pipecat、LiveKit、OpenAI Realtime和Gemini Live构建的语音代理进行追踪。可以捕获音频、STT和TTS延迟、中断、工具调用等信息,并整合到一个追踪中。

  • LangSmith推出Python集成,支持追踪四种主流语音代理框架。
  • 语音代理需要可观测性,包括音频记录、延迟分析和中断检测。
站内正文

自主AI的当前状态

到2026年中,自主AI架构已演进,原生推理模型取代了编排循环,多智能体蜂群和通过MCP标准化的工具协议成为主流。本文涵盖如何设计无状态专业智能体、记忆图和安全模式。

  • 原生推理模型使复杂的外部编排框架变得多余。
  • 通过交接工具连接无状态专业智能体的多智能体蜂群。
站内正文

AskCodi

AskCodi是一种AI工具,旨在大规模编排智能体同时降低成本。

  • 大规模编排AI智能体
  • 降低成本
站内正文

Show HN:Open-Kritt – 基于AI的安全研究开源基础设施

Open-Kritt 是一个开源、自托管的 AI 安全研究平台,通过编排 AI 代理并行执行细化任务,帮助安全研究人员和开发者高效发现代码漏洞。项目团队此前在漏洞悬赏中累计获得超过150万美元奖金。

  • 开源、自托管的 AI 安全研究平台,支持自建工作流与多代理并行扫描
  • 通过细化任务、去重与自定义严重性排名,提升漏洞发现效率
站内正文

IssueBench – 如何评估引擎

LangChain 构建了 IssueBench,这是一个合成基准测试,用于评估 LangSmith Engine 在代理轨迹中识别、分类和分组问题的能力。本文介绍了 IssueBench 的构成、评分方式以及构建过程中的经验教训。

  • IssueBench 包含 15 个任务,涉及 SRE 日志分析、软件工程和客户支持三个领域。
  • 引擎需要识别问题、分配失败类别、关联到现有问题并分组新故障。
站内正文

构建受治理的AI代理:成本、控制与合规框架

AI代理正成为生产基础设施的一部分,但随之而来的是治理挑战。本文提出了一个框架,通过LLM网关在运行时强制执行策略,涵盖安全性、身份认证、审计日志、数据隔离等基础,并提供了三种常见切入点(可见性主导、控制主导、保证主导)。网关与追踪、评估、监控系统集成,实现持续改进。

  • 治理需要运行时控制平面(LLM网关)来强制执行模型调用、工具调用和代理交互中的策略。
  • 基础包括安全性、身份认证、审计日志、用户管理、提供商密钥、数据分离和数据驻留。
站内正文

KDnuggets 每周综述:2026年7月13日周

本周精选包括如何用注册表模式替代If-Else链、降低LLM延迟和推理成本的12种方法、五个真实SQL项目构建数据作品集、Git Worktrees用于AI开发、用Outlines进行结构化语言模型生成、七个用于编排本地AI代理的Python框架、10个保持AI前沿的YouTube频道、Conductor for Gemini CLI入门、五个免费资源学习Agentic AI以及Pi编码代理的工作方式。

  • 用注册表模式替代if-else链可提高代码可扩展性
  • 降低LLM推理成本需优化令牌使用、模型路由和多层缓存
站内正文

Google Cloud 的 Always-On Memory Agent:用持续的 LLM 整合取代 RAG 和嵌入,基于 Gemini 3.1 Flash-Lite

Google Cloud 的生成式 AI 存储库发布了一个参考实现——Always-On Memory Agent,它将记忆视为一个持续运行的进程。该系统基于 Google ADK 和 Gemini 3.1 Flash-Lite,不使用向量数据库或嵌入,而是通过编排器将请求路由到摄取、整合和查询子代理,这些代理持续地读取、连接和将结构化记忆写入 SQLite。

  • Always-On Memory Agent 是一个轻量级的后台进程,全天候运行,使用 Google ADK 和 Gemini 3.1 Flash-Lite。
  • 它不使用向量数据库或嵌入,而是通过 LLM 将结构化记忆写入 SQLite。
站内正文

开源提取服务:从非结构化文本中提取结构化数据

LangChain 发布了一个开源提取服务的托管版本,支持从 PDF、HTML 和文本文件中提取结构化数据。该服务免费使用,但不宜用于生产环境或敏感数据。它允许用户定义提取模式、添加少量示例,并切换不同的 LLM 模型。通过一个简单的用户界面,开发者可以快速实验并集成到自己的 LangChain 工作流中。

  • LangChain 推出了一个开源结构化数据提取服务的托管版本,带有简单前端。
  • 支持 PDF、HTML 和文本文件,用户可自定义提取模式和提供少量示例。
站内正文

证明金融服务业中代理型AI的投资回报率

文章讨论了金融服务业中代理型AI(Agentic AI)的ROI证明问题,指出传统监控工具无法处理多代理系统的动态成本结构。通过两个实际用例——RFP处理流程自动化和反洗钱合规监控,展示了如何利用LangChain平台(含LangSmith和LangGraph)与Pay-i经济智能平台结合,将工程级可观测性连接到业务价值,从而向领导层证明AI投资回报。

  • 多代理系统的成本结构是动态的,传统FinOps工具无法处理。
  • LangSmith提供工程级可观测性,Pay-i将成本与业务成果关联。
站内正文

Shoplazza的Athena:您整个商业栈的编排代理

Athena是Shoplazza推出的AI编排代理,旨在统一管理整个商业技术栈,简化电商运营流程。

  • Athena是一个AI编排代理,整合商业栈中的多个工具
  • 帮助商家自动化工作流程,提高运营效率
站内正文

OpenWiki 0.2 为代码库文档引入 OKF 支持

OpenWiki 0.2 版本增加了对 OKF(一种知识 wiki 结构化标准)的支持,使开发者能够更好地组织和分类代码库文档,提升代理检索效率并减少令牌消耗。

  • OpenWiki 0.2 支持 OKF 格式,在 wiki 文件中添加 YAML 前置元数据(标题、描述、标签等)。
  • 新增 index.md 和 logs.md 文件,分别用于目录摘要和变更日志。
站内正文

Democr.ai:自托管代理AI运行时,具备审计与RBAC功能

Democr.ai 是一个开源的自托管代理AI运行时框架,集成了服务器驱动UI、多客户端渲染、多租户、RBAC、OS级沙箱、三层审计、可插拔AI引擎编排、知识子系统等核心功能。其核心理念是“一切皆模块”,无供应商锁定,强调安全作为原语。项目仍处于测试阶段,但架构已面向生产级约束。

  • Democr.ai 提供一个完整的运行时框架,集成UI、AI引擎、安全审计、多租户等能力。
  • 框架采用模块化架构,所有组件包括认证均为模块,通过公共SDK扩展。
站内正文

Show HN:Cybara – 基于 Bun 构建的开源 AI 代理平台

Cybara 是一个自托管的 AI 代理操作系统,结合了 Bun 代理运行时、Web UI、CLI、桌面应用、移动伴侣、加密钱包控制、多平台消息通道适配器和 MCP 支持。它支持多代理编排、浏览器自动化、安全消息传递和加密钱包操作,适合开发者和运营商。

  • 基于 Bun 构建,支持自托管和多种部署方式。
  • 具备丰富的内置工具库和模型提供商路由,支持多代理协作。
站内正文

代理编排:企业AI组织面临的不是平台问题,而是部署问题——大多数所谓的‘代理’只是聊天机器人

根据VentureBeat Pulse Research对101家企业的调查,企业代理编排正在向模型提供商平台集中,Anthropic的Claude以40%的使用率领先。然而,大多数部署的“代理”仍是简单的聊天机器人包装,真正的多步骤编排工作流仅占少数。企业预计到2026年底采用混合控制平面以避免供应商锁定,但实时成本控制仍不成熟。

  • Anthropic Claude是主要编排平台,占40%,远超其他竞品。
  • 71%的企业表示其部署的‘代理’中只有四分之一或更少是真正的多步骤编排工作流。
站内正文

Fleet新功能:一键将AI代理部署到Slack

LangChain的Fleet平台新增一键部署功能,允许用户无需编码即可创建并发布AI代理到Slack。代理可拥有自定义身份,在频道和线程中工作,并支持权限控制和审批流程。

  • Fleet支持用自然语言构建专业AI代理,无需编程。
  • 代理可一键部署到Slack,拥有独立身份,团队可识别和@提及。
站内正文

Atlassian 将 Jira 演变为开发者和 AI 代理的编排中心

Atlassian 宣布扩展 Jira,新增 Jira Planner、Jira Coding Agent 及第三方代理集成,旨在将 Jira 打造为开发者与 AI 代理协同工作的控制平台,解决规划与协调瓶颈问题。

  • Jira Planner 将不完整的项目想法转化为技术规范。
  • Jira Coding Agent 和第三方代理集成支持任务编排。
站内正文

智能体需要自己的计算机:如何安全地赋予它们

为了让AI智能体真正自主执行任务,它们需要一个隔离、安全且可快速部署的计算环境。本文介绍了智能体为何需要自己的“计算机”,以及LangSmith沙箱如何通过微虚拟机隔离、快照与分支、认证代理和安全执行等特性满足这一需求。同时讨论了提示注入等安全风险及缓解措施。

  • 智能体需要隔离的执行环境来运行代码、安装包和访问网络,而不仅仅是生成文本。
  • LangSmith沙箱为每个智能体提供硬件虚拟化的微虚拟机,启动时间低于1秒,且自动清理。
站内正文

7个用于编排本地AI代理的Python框架

本文介绍了七种Python工具,工程师在2026年实际使用它们来在本地基础设施上构建、协调和运行AI代理,涵盖从模型运行到决策编排的各个层面。

  • Ollama提供轻量级运行时,支持本地运行开源LLM,兼容OpenAI API。
  • Smolagents以最小抽象和代码即行动为特点,但依赖足够强大的本地模型。
站内正文

TormentNexus:开源AI控制平面,拥有26K+ MCP工具

TormentNexus是一个本地优先的开源AI控制平面,为多代理工作流提供持久记忆、MCP工具编排和自主基础设施管理。它支持38+ AI编码代理,具有渐进式工具路由、双层记忆架构和群集协调等功能。

  • 本地运行的开源AI控制平面,集成26K+ MCP工具。
  • 支持38+ AI编码代理,一键安装。
站内正文

使用Strands Agents和Amazon Bedrock实现多智能体社交智能

本文介绍了一个基于Strands Agents和Amazon Bedrock AgentCore构建的多智能体系统,用于自动化从潜在客户发现到个性化邮件生成的流程。文章比较了Swarm和Graph两种编排模式,通过头对头基准测试评估延迟、成本和邮件质量。系统使用四个专门智能体、加权评分和时态衰减,并提供了生产部署的治理控制。

  • 多智能体系统自动化潜在客户发现、信息丰富、评分和邮件生成的全流程
  • Swarm模式提供动态交接,邮件质量更高;Graph模式成本低25%,延迟更稳定
站内正文

更多增长标签

Agent 框架 AI News | AI News Hub