使用 ReviewBench 評估代碼審查代理
LangChain 構建了 ReviewBench,一個基於真實拉取請求反饋的基準,用於評估代碼審查代理。文章介紹了從真實審查評論中篩選任務、運行方式、評分指標、初步結果以及未來方向。
- ReviewBench 基於 LangSmith 倉庫中受信任審查者的真實 PR 評論構建。
- 通過 LLM 門控和人工篩選將原始評論轉化為可驗證的基準任務。
長尾標籤
追蹤 Agent 框架、編排、記憶、評測、工作流程自動化和生產部署。
LangChain 構建了 ReviewBench,一個基於真實拉取請求反饋的基準,用於評估代碼審查代理。文章介紹了從真實審查評論中篩選任務、運行方式、評分指標、初步結果以及未來方向。
語音代理的真正難點不是語音識別、大模型和語音合成三件套的簡單拼接,而是流式編排:流式語音識別、話輪檢測、流式生成、打斷處理以及語音約束下的工具調用。本文逐一拆解各環節的職責與易錯點,並給出無需付費 API 即可運行的代碼示例。
Google DeepMind發佈了Gemini Robotics 2,這是其下一代機器人的智能層。該版本包含三個模型:用於全身人形控制的視覺-語言-動作模型(VLA)、用於具身推理和任務編排的Gemini Robotics ER 2,以及可快速適應新機器人本體的設備端VLA。一個檢查點可驅動Apptronik Apollo 2和Franka Duo。僅ER 2公開可用。
LangSmith LLM網關現已公開測試,為生產環境中的代理模型調用提供集中治理層,包括成本控制、速率限制、模型回退和敏感數據保護,幫助團隊避免供應商鎖定並有效管理模型使用。
瞭解Similarweb如何使用LangSmith通過評分標準、忠實度檢查、追蹤和基線比較來評估長篇Agent研究報告。
Perplexity推出了SPACE沙箱平台,用於其Computer AI智能體,重點在於狀態管理而非僅僅隔離。該平台基於Firecracker微虛擬機、Kubernetes和Btrfs文件系統,實現高效快照、暫停/恢復和分支。SPACE比現有方案快3倍,每分鐘快照一次,可回滾一週。安全功能包括RBAC、即時訪問和逐工具控制。未來計劃提供API產品、支持第三方沙箱和本地/混合部署。Perplexity還引入了一種低成本編排器模型。
作者獨自參加2026年ICFP編程競賽,全程僅使用AI(Fable),最終在約200支隊伍中排名前25左右。文章反思了AI的優缺點、測試和編排的重要性,以及AI上下文丟失的挑戰。
本文展示瞭如何使用LangGraph和Strands在Amazon Bedrock AgentCore上構建生產級的多智能體AI系統。以市場監控為例,詳細説明了狀態驅動的工作流編排、基於檢查點的恢復機制以及AgentCore的內存和可觀測性功能。
Diagrid 發佈 Catalyst 2.0,為基於 LangGraph、Microsoft Agent Framework 等框架構建的 AI 代理添加持久執行和證明層,使其在中斷後能從最後一步恢復,並提供不可篡改的執行記錄,適用於金融、醫療等受監管行業。
LangChain數據團隊通過集成Hex、dbt、語義模型和可觀測性,構建了一個可靠的數據代理,將自助分析容量提升了40倍,同時將數據團隊的角色從回答每個問題轉變為改進系統。
研究人員提出了一種名為Pigey的物理代理編排器,它將機器人能力分解為高層管理器和低層策略,在LIBERO-PRO上實現了超過4倍的性能提升,在真實世界的推理任務中取得了接近100%的成功率。
Hydra是一個本地優先的AI編排命令行工具,它通過置信度路由和最優停止算法,在降低成本的同時保證質量。與雲端網關不同,Hydra在本地運行,支持離線操作,並具有問責賬本功能。
Sakana AI 發佈了 Fugu-Cyber,這是其 Fugu 編排模型的安全專用端點。報告顯示在 CyberGym 和 CTI-REALM 上的成功率分別為 86.9% 和 72.1%,略高於 GPT-5.5-Cyber 和 Claude Mythos Preview。訪問需經手動審批、防禦使用策略和代幣計劃。
企業必須控制自己的代理系統、治理、上下文和反饋循環,才能將通用AI轉化為持久的業務優勢。本文闡述了為何通用AI不足以創造差異化,並提供了實現智能所有權的具體策略,包括控制模型、編排、上下文,管理成本、質量和風險,以及構建持續改進的學習循環。
SHACKLE是一個開源的運行時治理層,實時仲裁每個代理工具調用,給出ALLOW/DENY/HITL判決。它包含SP/1.0一致性標準,提供15個哈希可驗證的測試向量,並設有認證級別。與LiteLLM和AutoGen集成,防止失控循環和預算超支。
本文深入探討了構建可靠的代理型AI系統所需的五個核心工程概念:通過MCP協議的工具使用、記憶與上下文工程、規劃與推理循環、多代理編排以及評估與防護措施。文章解釋了為什麼大部分AI代理無法投入生產,以及如何構建穩健的系統。
Kolega Code 是一個本地優先的終端編碼代理,支持多代理編排(Gigacode),適用於大規模代碼審查、遷移等任務。它允許多個專業子代理並行工作,支持多種模型提供商和路由,具備計劃與構建模式,以及豐富的工具集。
本文提出AINTMA(智能體智能測試管理架構),這是一個多智能體AI系統,旨在將傳統測試管理轉變為自主質量智能生態系統。該系統部署了六個專門的人工智能代理(測試發現、風險評估、強化學習優先級排序、執行編排、生成式質量智能和雲安全監控),通過安全的雲原生微服務基礎設施進行協調。評估表明,在12個異構軟件項目上,測試優先級排序準確率達88.4%,測試周期時間減少43%,缺陷逃逸率從8.3%降至2.1%,9個月投資回報率達340%。
Bohay 是一個開源終端工具,為多個AI編碼代理提供統一的監控和管理界面,包括代理狀態跟蹤、會話持久化、編排協作、Git集成、遠程SSH支持以及macOS劉海面板。
Kalytera是一款面向生產環境的AI代理評估工具,能夠自動捕獲每個步驟的失敗、用通俗英語指出根本原因,並發現重複出現的失敗模式。它提供100%流量覆蓋,支持LangChain、CrewAI等框架,免費層每月可評估10,000次會話。
本期內容包括:Jensen Huang 與 Harrison 探討開放代理系統的未來,發佈 NVIDIA NemoClaw for LangChain Deep Agents 藍圖;LangSmith Sandboxes 免費試用、Fleet Slack 集成、語音追蹤;開源項目 OpenWiki Brains、Deep Agents 與 Harbor 統一評估棧、RLMs 動態子代理;新課程《Deep Agents 入門》;以及多場線下活動和客户案例。
深度代理的開發因評估困難而頗具挑戰。我們最近改進了評估框架,利用 Harbor 在編碼、對話和檢索三大領域進行端到端評估,並分享了我們的實踐方法。
Motorway與AWS合作構建了端到端評估管道,將錯誤結果從每8次查詢1次減少到每50次1次,並將問題檢測時間從幾小時縮短到幾分鐘。該管道結合了Strands Agents SDK與Amazon Bedrock AgentCore,本文介紹瞭如何為您的代理構建此管道。
AgentNest 是一個開源運行時,用於在安全、可丟棄的沙箱中執行 AI 代理代碼。它支持 Python、shell 命令、文件、包、瀏覽器、GPU 和 Git,具有精細的網絡策略、有狀態的會話和可分支狀態。自託管且可擴展,與 LangChain、MCP 等集成。
本文介紹了Databricks如何利用Lakebase Postgres為AI代理構建一個可擴展、容錯的任務隊列,無需外部中間件。通過四個Postgres原生模式,實現了併發優先級感知的調度、基於租約的崩潰恢復、速率限制感知的節流以及冪等回調。同時,結合LISTEN/NOTIFY和SSE實現了實時操作儀表板。該架構已在CLA的審計解決方案中得到驗證,將文檔提取時間從數小時縮短至數分鐘。
AI Maestro是一個開源工具,通過將軟件交付流程編排為AI代理團隊而非單一對話,實現對任務板的智能管理。它支持基於任務板的票證路由、隔離的Git工作樹、可複用的技能庫以及可視化控制台,旨在提升多代理協作效率。
LangChain 發佈了評估工程技能,該技能通過檢查代理的倉庫結構和追蹤記錄,以訪談方式提出評估方案,並生成可執行的 Harbor 格式評估任務。
本文總結了LangChain團隊三年來使用LangGraph構建代理系統的經驗。圖工程並非新概念,而是構建可靠代理的成熟方法。文章介紹了何時使用圖、何時避免使用圖,以及從實踐中總結的關鍵教訓:代理圖通常不是有向無環圖(DAG),循環是簡單的圖,動態轉換很重要。
Apollo 使用 Deep Agents 和 LangSmith 驅動其 AI 助手,實現從潛在客户挖掘、信息豐富、外聯、分析到 MCP 集成的完整 GTM 循環。
LangSmith現已支持對基於Pipecat、LiveKit、OpenAI Realtime和Gemini Live構建的語音代理進行追蹤。可以捕獲音頻、STT和TTS延遲、中斷、工具調用等信息,並整合到一個追蹤中。
到2026年中,自主AI架構已演進,原生推理模型取代了編排循環,多智能體蜂羣和通過MCP標準化的工具協議成為主流。本文涵蓋如何設計無狀態專業智能體、記憶圖和安全模式。
AskCodi是一種AI工具,旨在大規模編排智能體同時降低成本。
Open-Kritt 是一個開源、自託管的 AI 安全研究平台,通過編排 AI 代理並行執行細化任務,幫助安全研究人員和開發者高效發現代碼漏洞。項目團隊此前在漏洞懸賞中累計獲得超過150萬美元獎金。
LangChain 構建了 IssueBench,這是一個合成基準測試,用於評估 LangSmith Engine 在代理軌跡中識別、分類和分組問題的能力。本文介紹了 IssueBench 的構成、評分方式以及構建過程中的經驗教訓。
AI代理正成為生產基礎設施的一部分,但隨之而來的是治理挑戰。本文提出了一個框架,通過LLM網關在運行時強制執行策略,涵蓋安全性、身份認證、審計日誌、數據隔離等基礎,並提供了三種常見切入點(可見性主導、控制主導、保證主導)。網關與追蹤、評估、監控系統集成,實現持續改進。
本週精選包括如何用註冊表模式替代If-Else鏈、降低LLM延遲和推理成本的12種方法、五個真實SQL項目構建數據作品集、Git Worktrees用於AI開發、用Outlines進行結構化語言模型生成、七個用於編排本地AI代理的Python框架、10個保持AI前沿的YouTube頻道、Conductor for Gemini CLI入門、五個免費資源學習Agentic AI以及Pi編碼代理的工作方式。
Google Cloud 的生成式 AI 存儲庫發佈了一個參考實現——Always-On Memory Agent,它將記憶視為一個持續運行的進程。該系統基於 Google ADK 和 Gemini 3.1 Flash-Lite,不使用向量數據庫或嵌入,而是通過編排器將請求路由到攝取、整合和查詢子代理,這些代理持續地讀取、連接和將結構化記憶寫入 SQLite。
LangChain 發佈了一個開源提取服務的託管版本,支持從 PDF、HTML 和文本文件中提取結構化數據。該服務免費使用,但不宜用於生產環境或敏感數據。它允許用户定義提取模式、添加少量示例,並切換不同的 LLM 模型。通過一個簡單的用户界面,開發者可以快速實驗並集成到自己的 LangChain 工作流中。
文章討論了金融服務業中代理型AI(Agentic AI)的ROI證明問題,指出傳統監控工具無法處理多代理系統的動態成本結構。通過兩個實際用例——RFP處理流程自動化和反洗錢合規監控,展示瞭如何利用LangChain平台(含LangSmith和LangGraph)與Pay-i經濟智能平台結合,將工程級可觀測性連接到業務價值,從而向領導層證明AI投資回報。
Athena是Shoplazza推出的AI編排代理,旨在統一管理整個商業技術棧,簡化電商運營流程。
OpenWiki 0.2 版本增加了對 OKF(一種知識 wiki 結構化標準)的支持,使開發者能夠更好地組織和分類代碼庫文檔,提升代理檢索效率並減少令牌消耗。
Democr.ai 是一個開源的自託管代理AI運行時框架,集成了服務器驅動UI、多客户端渲染、多租户、RBAC、OS級沙箱、三層審計、可插拔AI引擎編排、知識子系統等核心功能。其核心理念是“一切皆模塊”,無供應商鎖定,強調安全作為原語。項目仍處於測試階段,但架構已面向生產級約束。
Cybara 是一個自託管的 AI 代理操作系統,結合了 Bun 代理運行時、Web UI、CLI、桌面應用、移動伴侶、加密錢包控制、多平台消息通道適配器和 MCP 支持。它支持多代理編排、瀏覽器自動化、安全消息傳遞和加密錢包操作,適合開發者和運營商。
根據VentureBeat Pulse Research對101家企業的調查,企業代理編排正在向模型提供商平台集中,Anthropic的Claude以40%的使用率領先。然而,大多數部署的“代理”仍是簡單的聊天機器人包裝,真正的多步驟編排工作流僅佔少數。企業預計到2026年底採用混合控制平面以避免供應商鎖定,但實時成本控制仍不成熟。
LangChain的Fleet平台新增一鍵部署功能,允許用户無需編碼即可創建併發布AI代理到Slack。代理可擁有自定義身份,在頻道和線程中工作,並支持權限控制和審批流程。
Atlassian 宣佈擴展 Jira,新增 Jira Planner、Jira Coding Agent 及第三方代理集成,旨在將 Jira 打造為開發者與 AI 代理協同工作的控制平台,解決規劃與協調瓶頸問題。
為了讓AI智能體真正自主執行任務,它們需要一個隔離、安全且可快速部署的計算環境。本文介紹了智能體為何需要自己的“計算機”,以及LangSmith沙箱如何通過微虛擬機隔離、快照與分支、認證代理和安全執行等特性滿足這一需求。同時討論了提示注入等安全風險及緩解措施。
本文介紹了七種Python工具,工程師在2026年實際使用它們來在本地基礎設施上構建、協調和運行AI代理,涵蓋從模型運行到決策編排的各個層面。
TormentNexus是一個本地優先的開源AI控制平面,為多代理工作流提供持久記憶、MCP工具編排和自主基礎設施管理。它支持38+ AI編碼代理,具有漸進式工具路由、雙層記憶架構和羣集協調等功能。
本文介紹了一個基於Strands Agents和Amazon Bedrock AgentCore構建的多智能體系統,用於自動化從潛在客户發現到個性化郵件生成的流程。文章比較了Swarm和Graph兩種編排模式,通過頭對頭基準測試評估延遲、成本和郵件質量。系統使用四個專門智能體、加權評分和時態衰減,並提供了生產部署的治理控制。
追蹤 AI 編程助理、程式碼生成、IDE 插件、開發者工作流程和軟件工程自動化。
追蹤 Model Context Protocol、工具調用、連接器、Agent 上下文和企業整合。
追蹤開源權重模型、開放授權、社群評測、模型蒸餾和本地部署。
追蹤推理價格、延遲、吞吐、快取、量化、服務商成本和部署效率。
追蹤中國 AI 公司、模型、政策、芯片生態、開源社群和商業化進展。
追蹤 GPU、數據中心、集群網絡、AI 雲、訓練基礎設施和供應鏈。
追蹤模型 API 價格、方案、上下文窗口、免費額度、單位 token 成本和商業模式。
追蹤 DeepSeek 模型、API、開源權重、推理效率、生態合作和全球影響。
追蹤 Qwen/通義千問模型、開源權重、多模態、Agent 能力、API 和企業落地。