AI News HubLIVE

Agent 框架動態

使用 ReviewBench 評估代碼審查代理

LangChain 構建了 ReviewBench,一個基於真實拉取請求反饋的基準,用於評估代碼審查代理。文章介紹了從真實審查評論中篩選任務、運行方式、評分指標、初步結果以及未來方向。

  • ReviewBench 基於 LangSmith 倉庫中受信任審查者的真實 PR 評論構建。
  • 通過 LLM 門控和人工篩選將原始評論轉化為可驗證的基準任務。
站內正文

構建語音控制型AI代理

語音代理的真正難點不是語音識別、大模型和語音合成三件套的簡單拼接,而是流式編排:流式語音識別、話輪檢測、流式生成、打斷處理以及語音約束下的工具調用。本文逐一拆解各環節的職責與易錯點,並給出無需付費 API 即可運行的代碼示例。

  • 順序式“STT→LLM→TTS”流水線延遲過高,流式處理才是生產級語音代理的標準。
  • 人類對話的自然間隔約 200–300ms;超過 500ms 會明顯遲緩,超過 3 秒用户往往掛斷。
站內正文

Google DeepMind發佈三款實體AI模型,實現全身控制、靈巧操作與多機器人協作

Google DeepMind發佈了Gemini Robotics 2,這是其下一代機器人的智能層。該版本包含三個模型:用於全身人形控制的視覺-語言-動作模型(VLA)、用於具身推理和任務編排的Gemini Robotics ER 2,以及可快速適應新機器人本體的設備端VLA。一個檢查點可驅動Apptronik Apollo 2和Franka Duo。僅ER 2公開可用。

  • 三款模型同時發佈:VLA、具身推理VLM和設備端VLA。
  • 一個檢查點驅動Apollo 2(兩種手部)和Franka Duo夾爪。
站內正文

LangSmith LLM網關:為生產環境中的AI代理提供運行時控制

LangSmith LLM網關現已公開測試,為生產環境中的代理模型調用提供集中治理層,包括成本控制、速率限制、模型回退和敏感數據保護,幫助團隊避免供應商鎖定並有效管理模型使用。

  • LangSmith LLM網關作為代理與模型之間的集中治理層,提供運行時控制。
  • 支持成本上限、速率限制、模型回退和敏感數據編輯等關鍵控制。
站內正文

Similarweb如何使用LangSmith評估Agent報告

瞭解Similarweb如何使用LangSmith通過評分標準、忠實度檢查、追蹤和基線比較來評估長篇Agent研究報告。

  • 根據輸出類型匹配評估方法:標準答案適用於聚焦問題,而長篇報告需要評分標準、忠實度檢查和基線比較。
  • 將分數視為信號而非答案:Similarweb使用LangSmith將每個分數與評估者評論、追蹤和A/B比較關聯起來。
站內正文

“有狀態系統極難構建”:Perplexity對AI智能體沙箱的思考

Perplexity推出了SPACE沙箱平台,用於其Computer AI智能體,重點在於狀態管理而非僅僅隔離。該平台基於Firecracker微虛擬機、Kubernetes和Btrfs文件系統,實現高效快照、暫停/恢復和分支。SPACE比現有方案快3倍,每分鐘快照一次,可回滾一週。安全功能包括RBAC、即時訪問和逐工具控制。未來計劃提供API產品、支持第三方沙箱和本地/混合部署。Perplexity還引入了一種低成本編排器模型。

  • Perplexity的SPACE沙箱平台優先考慮狀態管理(暫停/恢復/分支)而非隔離。
  • 使用Firecracker微虛擬機、Kubernetes和Btrfs寫時複製文件系統提高性能。
站內正文

在AI免疫競賽中與AI合作取得還不錯的結果

作者獨自參加2026年ICFP編程競賽,全程僅使用AI(Fable),最終在約200支隊伍中排名前25左右。文章反思了AI的優缺點、測試和編排的重要性,以及AI上下文丟失的挑戰。

  • 僅使用AI(Fable)參加2026年ICFP編程競賽,本人未寫任何代碼。
  • 在約200支隊伍中排名前25左右。
站內正文

使用LangGraph和Strands在AgentCore上構建市場監控智能體

本文展示瞭如何使用LangGraph和Strands在Amazon Bedrock AgentCore上構建生產級的多智能體AI系統。以市場監控為例,詳細説明了狀態驅動的工作流編排、基於檢查點的恢復機制以及AgentCore的內存和可觀測性功能。

  • LangGraph負責宏觀工作流編排,支持狀態管理和檢查點恢復
  • Strands提供模型無關的智能推理,集成多種LLM和工具
站內正文

Diagrid 為失敗的AI代理提供恢復方法

Diagrid 發佈 Catalyst 2.0,為基於 LangGraph、Microsoft Agent Framework 等框架構建的 AI 代理添加持久執行和證明層,使其在中斷後能從最後一步恢復,並提供不可篡改的執行記錄,適用於金融、醫療等受監管行業。

  • Catalyst 2.0 為 AI 代理提供持久執行,支持中斷後從最後一步恢復,無需從頭重試。
  • 該工具基於開源 Dapr 項目,可攔截主流代理框架的執行循環,將操作註冊為工作流步驟。
站內正文

LangChain如何構建以代理為先的數據棧

LangChain數據團隊通過集成Hex、dbt、語義模型和可觀測性,構建了一個可靠的數據代理,將自助分析容量提升了40倍,同時將數據團隊的角色從回答每個問題轉變為改進系統。

  • 可靠的數據代理需要清晰的模型、指標定義、業務上下文和信任信號。
  • 代理優先的棧可將自助服務擴展40倍,處理此前三人數據團隊的請求量。
站內正文

通過物理代理解決通用機器人中的編排鴻溝

研究人員提出了一種名為Pigey的物理代理編排器,它將機器人能力分解為高層管理器和低層策略,在LIBERO-PRO上實現了超過4倍的性能提升,在真實世界的推理任務中取得了接近100%的成功率。

  • Pigey將高層規劃與低層控制分離,無需大規模預訓練。
  • 該編排器形成閉環,能夠進行目標分解、命令執行、結果驗證和故障恢復。
站內正文

Hydra:一個本地優先的信任控制平面,根據置信度路由AI請求

Hydra是一個本地優先的AI編排命令行工具,它通過置信度路由和最優停止算法,在降低成本的同時保證質量。與雲端網關不同,Hydra在本地運行,支持離線操作,並具有問責賬本功能。

  • Hydra是首個本地優先的信任控制平面,路由AI請求時基於置信度而非簡單成本。
  • 它使用成本/質量帕累託前沿、順序概率比檢驗(SPRT)和滲透理論來優化路由。
站內正文

Sakana AI 發佈 Fugu-Cyber:編排模型在 CyberGym 上報告 86.9%,在 CTI-REALM 上報告 72.1%

Sakana AI 發佈了 Fugu-Cyber,這是其 Fugu 編排模型的安全專用端點。報告顯示在 CyberGym 和 CTI-REALM 上的成功率分別為 86.9% 和 72.1%,略高於 GPT-5.5-Cyber 和 Claude Mythos Preview。訪問需經手動審批、防禦使用策略和代幣計劃。

  • Fugu-Cyber 是編排端點,而非新前沿模型,於 2026 年 7 月 21 日推出。
  • Sakana 報告 CyberGym 86.9% 和 CTI-REALM 72.1%,均為自報且未復現。
站內正文

掌握你的智能:實現持久AI優勢的關鍵

企業必須控制自己的代理系統、治理、上下文和反饋循環,才能將通用AI轉化為持久的業務優勢。本文闡述了為何通用AI不足以創造差異化,並提供了實現智能所有權的具體策略,包括控制模型、編排、上下文,管理成本、質量和風險,以及構建持續改進的學習循環。

  • 通用AI無法提供持久的競爭優勢,企業需要針對自身業務定製的智能。
  • 智能所有權意味着控制代理系統的三層:模型、編排和上下文。
站內正文

Shackle:AI代理的預執行ALLOW/DENY/HITL門控(開源)

SHACKLE是一個開源的運行時治理層,實時仲裁每個代理工具調用,給出ALLOW/DENY/HITL判決。它包含SP/1.0一致性標準,提供15個哈希可驗證的測試向量,並設有認證級別。與LiteLLM和AutoGen集成,防止失控循環和預算超支。

  • SHACKLE為AI代理工具調用提供斷路器,三種判決:允許、拒絕、人工介入。
  • 實施SP/1.0一致性標準,具有可驗證的測試夾具。
站內正文

每位工程師必須理解的代理型人工智能五大關鍵概念

本文深入探討了構建可靠的代理型AI系統所需的五個核心工程概念:通過MCP協議的工具使用、記憶與上下文工程、規劃與推理循環、多代理編排以及評估與防護措施。文章解釋了為什麼大部分AI代理無法投入生產,以及如何構建穩健的系統。

  • 使用模型上下文協議(MCP)標準化工具調用,讓代理無需自定義集成即可與外部服務交互。
  • 記憶作為獨立於上下文窗口的架構組件,藉助Mem0、Zep等工具實現精準檢索。
站內正文

前沿模型定價太坑,我開發了一個開源CLI工具

Kolega Code 是一個本地優先的終端編碼代理,支持多代理編排(Gigacode),適用於大規模代碼審查、遷移等任務。它允許多個專業子代理並行工作,支持多種模型提供商和路由,具備計劃與構建模式,以及豐富的工具集。

  • Kolega Code 是一個開源的本地優先終端編碼代理,支持多代理協作。
  • 通過 Gigacode 功能,可並行執行多個子任務,提升大型代碼庫的處理效率。
站內正文

AINTMA:面向自主測試管理的智能體AI架構,融合生成式智能、安全雲通信與自適應質量分析

本文提出AINTMA(智能體智能測試管理架構),這是一個多智能體AI系統,旨在將傳統測試管理轉變為自主質量智能生態系統。該系統部署了六個專門的人工智能代理(測試發現、風險評估、強化學習優先級排序、執行編排、生成式質量智能和雲安全監控),通過安全的雲原生微服務基礎設施進行協調。評估表明,在12個異構軟件項目上,測試優先級排序準確率達88.4%,測試周期時間減少43%,缺陷逃逸率從8.3%降至2.1%,9個月投資回報率達340%。

  • AINTMA是一個多智能體AI系統,包含六個專門代理,用於自主測試管理。
  • 生成式質量智能代理利用大語言模型生成自然語言質量報告和測試建議。
站內正文

Show HN:Bohay – AI編碼代理的指揮中心

Bohay 是一個開源終端工具,為多個AI編碼代理提供統一的監控和管理界面,包括代理狀態跟蹤、會話持久化、編排協作、Git集成、遠程SSH支持以及macOS劉海面板。

  • Bohay 提供單一終端視圖實時監控AI代理(Claude、Copilot、Codex等)的狀態。
  • 支持會話持久化,重啓後代理自動恢復歷史記錄。
站內正文

Kalytera:不僅告訴你AI代理失敗,還告訴你失敗原因

Kalytera是一款面向生產環境的AI代理評估工具,能夠自動捕獲每個步驟的失敗、用通俗英語指出根本原因,並發現重複出現的失敗模式。它提供100%流量覆蓋,支持LangChain、CrewAI等框架,免費層每月可評估10,000次會話。

  • 對代理的每個步驟進行四維評分:準確性、目標對齊、決策質量、完整性
  • 自動識別失敗模式並按頻率排名,給出可操作的修復建議
站內正文

2026年7月:LangChain 新聞通訊 — NemoClaw 藍圖、OpenWiki Brains 等

本期內容包括:Jensen Huang 與 Harrison 探討開放代理系統的未來,發佈 NVIDIA NemoClaw for LangChain Deep Agents 藍圖;LangSmith Sandboxes 免費試用、Fleet Slack 集成、語音追蹤;開源項目 OpenWiki Brains、Deep Agents 與 Harbor 統一評估棧、RLMs 動態子代理;新課程《Deep Agents 入門》;以及多場線下活動和客户案例。

  • Jensen Huang 和 Harrison 強調開放代理系統的重要性,並推出 NemoClaw 藍圖。
  • LangSmith 推出 Sandboxes 免費試用、Slack 集成和語音追蹤功能。
站內正文

我們如何對深度代理進行基準測試

深度代理的開發因評估困難而頗具挑戰。我們最近改進了評估框架,利用 Harbor 在編碼、對話和檢索三大領域進行端到端評估,並分享了我們的實踐方法。

  • 使用 Harbor 進行端到端評估,包含環境、指令和評估腳本。
  • 三大基準測試:Harbor-Index(自主工作)、τ³-bench(對話)、ContextBench(檢索)。
站內正文

評估AI代理:使用Strands和AgentCore的生產藍圖

Motorway與AWS合作構建了端到端評估管道,將錯誤結果從每8次查詢1次減少到每50次1次,並將問題檢測時間從幾小時縮短到幾分鐘。該管道結合了Strands Agents SDK與Amazon Bedrock AgentCore,本文介紹瞭如何為您的代理構建此管道。

  • Motorway與AWS合作構建AI驅動的經銷商庫存搜索代理,將自然語言查詢轉化為搜索結果。
  • 兩階段評估策略:構建時測試(strands-agents-evals)和生產監控(Amazon Bedrock AgentCore Evaluations)。
站內正文

展示 HN:AgentNest —— AI 代理的自託管沙箱

AgentNest 是一個開源運行時,用於在安全、可丟棄的沙箱中執行 AI 代理代碼。它支持 Python、shell 命令、文件、包、瀏覽器、GPU 和 Git,具有精細的網絡策略、有狀態的會話和可分支狀態。自託管且可擴展,與 LangChain、MCP 等集成。

  • 自託管沙箱,具有安全默認和出口白名單
  • 有狀態的 Python 會話和可分支沙箱,適合代理工作流
站內正文

使用Lakebase Postgres簡化AI代理編排

本文介紹了Databricks如何利用Lakebase Postgres為AI代理構建一個可擴展、容錯的任務隊列,無需外部中間件。通過四個Postgres原生模式,實現了併發優先級感知的調度、基於租約的崩潰恢復、速率限制感知的節流以及冪等回調。同時,結合LISTEN/NOTIFY和SSE實現了實時操作儀表板。該架構已在CLA的審計解決方案中得到驗證,將文檔提取時間從數小時縮短至數分鐘。

  • Lakebase Postgres作為單一存儲後端,替代了傳統架構中的消息隊列、調度器和緩存層。
  • 通過FOR UPDATE SKIP LOCKED實現併發安全且優先級感知的任務出隊。
站內正文

AI Maestro:指揮AI編程代理團隊處理任務板

AI Maestro是一個開源工具,通過將軟件交付流程編排為AI代理團隊而非單一對話,實現對任務板的智能管理。它支持基於任務板的票證路由、隔離的Git工作樹、可複用的技能庫以及可視化控制台,旨在提升多代理協作效率。

  • 任務板作為唯一真相源,工作狀態在上下文重置和並行會話中不會丟失。
  • 每個票證指定代理流水線和模型,實現任務與模型的精準匹配。
站內正文

評估工程技能:從倉庫上下文和追蹤構建評估

LangChain 發佈了評估工程技能,該技能通過檢查代理的倉庫結構和追蹤記錄,以訪談方式提出評估方案,並生成可執行的 Harbor 格式評估任務。

  • 新技能自動分析代理倉庫和追蹤,提出待測試能力。
  • 通過用户訪談迭代完善評估,而非一次性生成。
站內正文

用LangGraph進行圖工程:三年經驗總結

本文總結了LangChain團隊三年來使用LangGraph構建代理系統的經驗。圖工程並非新概念,而是構建可靠代理的成熟方法。文章介紹了何時使用圖、何時避免使用圖,以及從實踐中總結的關鍵教訓:代理圖通常不是有向無環圖(DAG),循環是簡單的圖,動態轉換很重要。

  • 圖工程是通過圖表表示代理系統工作流的方法,平衡了確定性和自主性。
  • LangGraph自2023年推出以來,每月下載量超過6500萬次,被初創企業和大型企業廣泛採用。
站內正文

Apollo 如何利用 Deep Agents 和 LangSmith 構建 GTM AI

Apollo 使用 Deep Agents 和 LangSmith 驅動其 AI 助手,實現從潛在客户挖掘、信息豐富、外聯、分析到 MCP 集成的完整 GTM 循環。

  • Apollo 將 AI 助手從監督式架構重構為基於 Deep Agents 的技能庫架構,提升了靈活性和效率。
  • 新架構使開發週期縮短約 80-85%,並顯著減少了用户確認提示。
站內正文

在LangSmith中追蹤語音代理

LangSmith現已支持對基於Pipecat、LiveKit、OpenAI Realtime和Gemini Live構建的語音代理進行追蹤。可以捕獲音頻、STT和TTS延遲、中斷、工具調用等信息,並整合到一個追蹤中。

  • LangSmith推出Python集成,支持追蹤四種主流語音代理框架。
  • 語音代理需要可觀測性,包括音頻記錄、延遲分析和中斷檢測。
站內正文

自主AI的當前狀態

到2026年中,自主AI架構已演進,原生推理模型取代了編排循環,多智能體蜂羣和通過MCP標準化的工具協議成為主流。本文涵蓋如何設計無狀態專業智能體、記憶圖和安全模式。

  • 原生推理模型使複雜的外部編排框架變得多餘。
  • 通過交接工具連接無狀態專業智能體的多智能體蜂羣。
站內正文

AskCodi

AskCodi是一種AI工具,旨在大規模編排智能體同時降低成本。

  • 大規模編排AI智能體
  • 降低成本
站內正文

Show HN:Open-Kritt – 基於AI的安全研究開源基礎設施

Open-Kritt 是一個開源、自託管的 AI 安全研究平台,通過編排 AI 代理並行執行細化任務,幫助安全研究人員和開發者高效發現代碼漏洞。項目團隊此前在漏洞懸賞中累計獲得超過150萬美元獎金。

  • 開源、自託管的 AI 安全研究平台,支持自建工作流與多代理並行掃描
  • 通過細化任務、去重與自定義嚴重性排名,提升漏洞發現效率
站內正文

IssueBench – 如何評估引擎

LangChain 構建了 IssueBench,這是一個合成基準測試,用於評估 LangSmith Engine 在代理軌跡中識別、分類和分組問題的能力。本文介紹了 IssueBench 的構成、評分方式以及構建過程中的經驗教訓。

  • IssueBench 包含 15 個任務,涉及 SRE 日誌分析、軟件工程和客户支持三個領域。
  • 引擎需要識別問題、分配失敗類別、關聯到現有問題並分組新故障。
站內正文

構建受治理的AI代理:成本、控制與合規框架

AI代理正成為生產基礎設施的一部分,但隨之而來的是治理挑戰。本文提出了一個框架,通過LLM網關在運行時強制執行策略,涵蓋安全性、身份認證、審計日誌、數據隔離等基礎,並提供了三種常見切入點(可見性主導、控制主導、保證主導)。網關與追蹤、評估、監控系統集成,實現持續改進。

  • 治理需要運行時控制平面(LLM網關)來強制執行模型調用、工具調用和代理交互中的策略。
  • 基礎包括安全性、身份認證、審計日誌、用户管理、提供商密鑰、數據分離和數據駐留。
站內正文

KDnuggets 每週綜述:2026年7月13日周

本週精選包括如何用註冊表模式替代If-Else鏈、降低LLM延遲和推理成本的12種方法、五個真實SQL項目構建數據作品集、Git Worktrees用於AI開發、用Outlines進行結構化語言模型生成、七個用於編排本地AI代理的Python框架、10個保持AI前沿的YouTube頻道、Conductor for Gemini CLI入門、五個免費資源學習Agentic AI以及Pi編碼代理的工作方式。

  • 用註冊表模式替代if-else鏈可提高代碼可擴展性
  • 降低LLM推理成本需優化令牌使用、模型路由和多層緩存
站內正文

Google Cloud 的 Always-On Memory Agent:用持續的 LLM 整合取代 RAG 和嵌入,基於 Gemini 3.1 Flash-Lite

Google Cloud 的生成式 AI 存儲庫發佈了一個參考實現——Always-On Memory Agent,它將記憶視為一個持續運行的進程。該系統基於 Google ADK 和 Gemini 3.1 Flash-Lite,不使用向量數據庫或嵌入,而是通過編排器將請求路由到攝取、整合和查詢子代理,這些代理持續地讀取、連接和將結構化記憶寫入 SQLite。

  • Always-On Memory Agent 是一個輕量級的後台進程,全天候運行,使用 Google ADK 和 Gemini 3.1 Flash-Lite。
  • 它不使用向量數據庫或嵌入,而是通過 LLM 將結構化記憶寫入 SQLite。
站內正文

開源提取服務:從非結構化文本中提取結構化數據

LangChain 發佈了一個開源提取服務的託管版本,支持從 PDF、HTML 和文本文件中提取結構化數據。該服務免費使用,但不宜用於生產環境或敏感數據。它允許用户定義提取模式、添加少量示例,並切換不同的 LLM 模型。通過一個簡單的用户界面,開發者可以快速實驗並集成到自己的 LangChain 工作流中。

  • LangChain 推出了一個開源結構化數據提取服務的託管版本,帶有簡單前端。
  • 支持 PDF、HTML 和文本文件,用户可自定義提取模式和提供少量示例。
站內正文

證明金融服務業中代理型AI的投資回報率

文章討論了金融服務業中代理型AI(Agentic AI)的ROI證明問題,指出傳統監控工具無法處理多代理系統的動態成本結構。通過兩個實際用例——RFP處理流程自動化和反洗錢合規監控,展示瞭如何利用LangChain平台(含LangSmith和LangGraph)與Pay-i經濟智能平台結合,將工程級可觀測性連接到業務價值,從而向領導層證明AI投資回報。

  • 多代理系統的成本結構是動態的,傳統FinOps工具無法處理。
  • LangSmith提供工程級可觀測性,Pay-i將成本與業務成果關聯。
站內正文

Shoplazza的Athena:您整個商業棧的編排代理

Athena是Shoplazza推出的AI編排代理,旨在統一管理整個商業技術棧,簡化電商運營流程。

  • Athena是一個AI編排代理,整合商業棧中的多個工具
  • 幫助商家自動化工作流程,提高運營效率
站內正文

OpenWiki 0.2 為代碼庫文檔引入 OKF 支持

OpenWiki 0.2 版本增加了對 OKF(一種知識 wiki 結構化標準)的支持,使開發者能夠更好地組織和分類代碼庫文檔,提升代理檢索效率並減少令牌消耗。

  • OpenWiki 0.2 支持 OKF 格式,在 wiki 文件中添加 YAML 前置元數據(標題、描述、標籤等)。
  • 新增 index.md 和 logs.md 文件,分別用於目錄摘要和變更日誌。
站內正文

Democr.ai:自託管代理AI運行時,具備審計與RBAC功能

Democr.ai 是一個開源的自託管代理AI運行時框架,集成了服務器驅動UI、多客户端渲染、多租户、RBAC、OS級沙箱、三層審計、可插拔AI引擎編排、知識子系統等核心功能。其核心理念是“一切皆模塊”,無供應商鎖定,強調安全作為原語。項目仍處於測試階段,但架構已面向生產級約束。

  • Democr.ai 提供一個完整的運行時框架,集成UI、AI引擎、安全審計、多租户等能力。
  • 框架採用模塊化架構,所有組件包括認證均為模塊,通過公共SDK擴展。
站內正文

Show HN:Cybara – 基於 Bun 構建的開源 AI 代理平台

Cybara 是一個自託管的 AI 代理操作系統,結合了 Bun 代理運行時、Web UI、CLI、桌面應用、移動伴侶、加密錢包控制、多平台消息通道適配器和 MCP 支持。它支持多代理編排、瀏覽器自動化、安全消息傳遞和加密錢包操作,適合開發者和運營商。

  • 基於 Bun 構建,支持自託管和多種部署方式。
  • 具備豐富的內置工具庫和模型提供商路由,支持多代理協作。
站內正文

代理編排:企業AI組織面臨的不是平台問題,而是部署問題——大多數所謂的‘代理’只是聊天機器人

根據VentureBeat Pulse Research對101家企業的調查,企業代理編排正在向模型提供商平台集中,Anthropic的Claude以40%的使用率領先。然而,大多數部署的“代理”仍是簡單的聊天機器人包裝,真正的多步驟編排工作流僅佔少數。企業預計到2026年底採用混合控制平面以避免供應商鎖定,但實時成本控制仍不成熟。

  • Anthropic Claude是主要編排平台,佔40%,遠超其他競品。
  • 71%的企業表示其部署的‘代理’中只有四分之一或更少是真正的多步驟編排工作流。
站內正文

Fleet新功能:一鍵將AI代理部署到Slack

LangChain的Fleet平台新增一鍵部署功能,允許用户無需編碼即可創建併發布AI代理到Slack。代理可擁有自定義身份,在頻道和線程中工作,並支持權限控制和審批流程。

  • Fleet支持用自然語言構建專業AI代理,無需編程。
  • 代理可一鍵部署到Slack,擁有獨立身份,團隊可識別和@提及。
站內正文

Atlassian 將 Jira 演變為開發者和 AI 代理的編排中心

Atlassian 宣佈擴展 Jira,新增 Jira Planner、Jira Coding Agent 及第三方代理集成,旨在將 Jira 打造為開發者與 AI 代理協同工作的控制平台,解決規劃與協調瓶頸問題。

  • Jira Planner 將不完整的項目想法轉化為技術規範。
  • Jira Coding Agent 和第三方代理集成支持任務編排。
站內正文

智能體需要自己的計算機:如何安全地賦予它們

為了讓AI智能體真正自主執行任務,它們需要一個隔離、安全且可快速部署的計算環境。本文介紹了智能體為何需要自己的“計算機”,以及LangSmith沙箱如何通過微虛擬機隔離、快照與分支、認證代理和安全執行等特性滿足這一需求。同時討論了提示注入等安全風險及緩解措施。

  • 智能體需要隔離的執行環境來運行代碼、安裝包和訪問網絡,而不僅僅是生成文本。
  • LangSmith沙箱為每個智能體提供硬件虛擬化的微虛擬機,啓動時間低於1秒,且自動清理。
站內正文

7個用於編排本地AI代理的Python框架

本文介紹了七種Python工具,工程師在2026年實際使用它們來在本地基礎設施上構建、協調和運行AI代理,涵蓋從模型運行到決策編排的各個層面。

  • Ollama提供輕量級運行時,支持本地運行開源LLM,兼容OpenAI API。
  • Smolagents以最小抽象和代碼即行動為特點,但依賴足夠強大的本地模型。
站內正文

TormentNexus:開源AI控制平面,擁有26K+ MCP工具

TormentNexus是一個本地優先的開源AI控制平面,為多代理工作流提供持久記憶、MCP工具編排和自主基礎設施管理。它支持38+ AI編碼代理,具有漸進式工具路由、雙層記憶架構和羣集協調等功能。

  • 本地運行的開源AI控制平面,集成26K+ MCP工具。
  • 支持38+ AI編碼代理,一鍵安裝。
站內正文

使用Strands Agents和Amazon Bedrock實現多智能體社交智能

本文介紹了一個基於Strands Agents和Amazon Bedrock AgentCore構建的多智能體系統,用於自動化從潛在客户發現到個性化郵件生成的流程。文章比較了Swarm和Graph兩種編排模式,通過頭對頭基準測試評估延遲、成本和郵件質量。系統使用四個專門智能體、加權評分和時態衰減,並提供了生產部署的治理控制。

  • 多智能體系統自動化潛在客户發現、信息豐富、評分和郵件生成的全流程
  • Swarm模式提供動態交接,郵件質量更高;Graph模式成本低25%,延遲更穩定
站內正文

更多增長標籤

Agent 框架 AI News | AI News Hub