透過物理代理解決通用機器人中的編排鴻溝
研究人員提出了一種名為Pigey的物理代理編排器,它將機器人能力分解為高層管理器和低層策略,在LIBERO-PRO上實現了超過4倍的效能提升,在真實世界的推理任務中取得了接近100%的成功率。
- Pigey將高層規劃與低層控制分離,無需大規模預訓練。
- 該編排器形成閉環,能夠進行目標分解、命令執行、結果驗證和故障恢復。
長尾標籤
追蹤 Agent 框架、編排、記憶、評測、工作流程自動化和生產部署。
研究人員提出了一種名為Pigey的物理代理編排器,它將機器人能力分解為高層管理器和低層策略,在LIBERO-PRO上實現了超過4倍的效能提升,在真實世界的推理任務中取得了接近100%的成功率。
Hydra是一個本地優先的AI編排命令列工具,它透過置信度路由和最優停止演算法,在降低成本的同時保證質量。與雲端閘道器不同,Hydra在本地執行,支援離線操作,並具有問責賬本功能。
Sakana AI 釋出了 Fugu-Cyber,這是其 Fugu 編排模型的安全專用端點。報告顯示在 CyberGym 和 CTI-REALM 上的成功率分別為 86.9% 和 72.1%,略高於 GPT-5.5-Cyber 和 Claude Mythos Preview。訪問需經手動審批、防禦使用策略和代幣計劃。
企業必須控制自己的代理系統、治理、上下文和反饋迴圈,才能將通用AI轉化為持久的業務優勢。本文闡述了為何通用AI不足以創造差異化,並提供了實現智慧所有權的具體策略,包括控制模型、編排、上下文,管理成本、質量和風險,以及構建持續改進的學習迴圈。
SHACKLE是一個開源的執行時治理層,即時仲裁每個代理工具呼叫,給出ALLOW/DENY/HITL判決。它包含SP/1.0一致性標準,提供15個雜湊可驗證的測試向量,並設有認證級別。與LiteLLM和AutoGen整合,防止失控迴圈和預算超支。
本文深入探討了構建可靠的代理型AI系統所需的五個核心工程概念:透過MCP協議的工具使用、記憶與上下文工程、規劃與推理迴圈、多代理編排以及評估與防護措施。文章解釋了為什麼大部分AI代理無法投入生產,以及如何構建穩健的系統。
Kolega Code 是一個本地優先的終端編碼代理,支援多代理編排(Gigacode),適用於大規模程式碼審查、遷移等任務。它允許多個專業子代理並行工作,支援多種模型提供商和路由,具備計劃與構建模式,以及豐富的工具集。
本文提出AINTMA(智慧體智慧測試管理架構),這是一個多智慧體AI系統,旨在將傳統測試管理轉變為自主質量智慧生態系統。該系統部署了六個專門的人工智慧代理(測試發現、風險評估、強化學習優先順序排序、執行編排、生成式質量智慧和雲安全監控),透過安全的雲原生微服務基礎設施進行協調。評估表明,在12個異構軟體專案上,測試優先順序排序準確率達88.4%,測試周期時間減少43%,缺陷逃逸率從8.3%降至2.1%,9個月投資回報率達340%。
Bohay 是一個開源終端工具,為多個AI編碼代理提供統一的監控和管理介面,包括代理狀態跟蹤、會話持久化、編排協作、Git整合、遠端SSH支援以及macOS劉海面板。
Kalytera是一款面向生產環境的AI代理評估工具,能夠自動捕獲每個步驟的失敗、用通俗英語指出根本原因,並發現重複出現的失敗模式。它提供100%流量覆蓋,支援LangChain、CrewAI等框架,免費層每月可評估10,000次會話。
本期內容包括:Jensen Huang 與 Harrison 探討開放代理系統的未來,釋出 NVIDIA NemoClaw for LangChain Deep Agents 藍圖;LangSmith Sandboxes 免費試用、Fleet Slack 整合、語音追蹤;開源專案 OpenWiki Brains、Deep Agents 與 Harbor 統一評估棧、RLMs 動態子代理;新課程《Deep Agents 入門》;以及多場線下活動和客戶案例。
深度代理的開發因評估困難而頗具挑戰。我們最近改進了評估框架,利用 Harbor 在編碼、對話和檢索三大領域進行端到端評估,並分享了我們的實踐方法。
Motorway與AWS合作構建了端到端評估管道,將錯誤結果從每8次查詢1次減少到每50次1次,並將問題檢測時間從幾小時縮短到幾分鐘。該管道結合了Strands Agents SDK與Amazon Bedrock AgentCore,本文介紹瞭如何為您的代理構建此管道。
AgentNest 是一個開源執行時,用於在安全、可丟棄的沙箱中執行 AI 代理程式碼。它支援 Python、shell 命令、檔案、包、瀏覽器、GPU 和 Git,具有精細的網路策略、有狀態的會話和可分支狀態。自託管且可擴充套件,與 LangChain、MCP 等整合。
本文介紹了Databricks如何利用Lakebase Postgres為AI代理構建一個可擴充套件、容錯的任務佇列,無需外部中介軟體。透過四個Postgres原生模式,實現了併發優先順序感知的排程、基於租約的崩潰恢復、速率限制感知的節流以及冪等回撥。同時,結合LISTEN/NOTIFY和SSE實現了即時操作儀表板。該架構已在CLA的審計解決方案中得到驗證,將文件提取時間從數小時縮短至數分鐘。
AI Maestro是一個開源工具,透過將軟體交付流程編排為AI代理團隊而非單一對話,實現對任務板的智慧管理。它支援基於任務板的票證路由、隔離的Git工作樹、可複用的技能庫以及視覺化控制台,旨在提升多代理協作效率。
LangChain 釋出了評估工程技能,該技能透過檢查代理的倉庫結構和追蹤記錄,以訪談方式提出評估方案,並生成可執行的 Harbor 格式評估任務。
本文總結了LangChain團隊三年來使用LangGraph構建代理系統的經驗。圖工程並非新概念,而是構建可靠代理的成熟方法。文章介紹了何時使用圖、何時避免使用圖,以及從實踐中總結的關鍵教訓:代理圖通常不是有向無環圖(DAG),迴圈是簡單的圖,動態轉換很重要。
Apollo 使用 Deep Agents 和 LangSmith 驅動其 AI 助手,實現從潛在客戶挖掘、資訊豐富、外聯、分析到 MCP 整合的完整 GTM 迴圈。
LangSmith現已支援對基於Pipecat、LiveKit、OpenAI Realtime和Gemini Live構建的語音代理進行追蹤。可以捕獲音訊、STT和TTS延遲、中斷、工具呼叫等資訊,並整合到一個追蹤中。
AskCodi是一種AI工具,旨在大規模編排智慧體同時降低成本。
Open-Kritt 是一個開源、自託管的 AI 安全研究平臺,透過編排 AI 代理並行執行細化任務,幫助安全研究人員和開發者高效發現程式碼漏洞。專案團隊此前在漏洞懸賞中累計獲得超過150萬美元獎金。
LangChain 構建了 IssueBench,這是一個合成基準測試,用於評估 LangSmith Engine 在代理軌跡中識別、分類和分組問題的能力。本文介紹了 IssueBench 的構成、評分方式以及構建過程中的經驗教訓。
AI代理正成為生產基礎設施的一部分,但隨之而來的是治理挑戰。本文提出了一個框架,透過LLM閘道器在執行時強制執行策略,涵蓋安全性、身份認證、審計日誌、資料隔離等基礎,並提供了三種常見切入點(可見性主導、控制主導、保證主導)。閘道器與追蹤、評估、監控系統整合,實現持續改進。
本週精選包括如何用登錄檔模式替代If-Else鏈、降低LLM延遲和推理成本的12種方法、五個真實SQL專案構建資料作品集、Git Worktrees用於AI開發、用Outlines進行結構化語言模型生成、七個用於編排本地AI代理的Python框架、10個保持AI前沿的YouTube頻道、Conductor for Gemini CLI入門、五個免費資源學習Agentic AI以及Pi編碼代理的工作方式。
Google Cloud 的生成式 AI 儲存庫釋出了一個參考實現——Always-On Memory Agent,它將記憶視為一個持續執行的程序。該系統基於 Google ADK 和 Gemini 3.1 Flash-Lite,不使用向量資料庫或嵌入,而是透過編排器將請求路由到攝取、整合和查詢子代理,這些代理持續地讀取、連線和將結構化記憶寫入 SQLite。
LangChain 釋出了一個開源提取服務的託管版本,支援從 PDF、HTML 和文本檔案中提取結構化資料。該服務免費使用,但不宜用於生產環境或敏感資料。它允許使用者定義提取模式、新增少量示例,並切換不同的 LLM 模型。透過一個簡單的使用者介面,開發者可以快速實驗並整合到自己的 LangChain 工作流中。
文章討論了金融服務業中代理型AI(Agentic AI)的ROI證明問題,指出傳統監控工具無法處理多代理系統的動態成本結構。透過兩個實際用例——RFP處理流程自動化和反洗錢合規監控,展示瞭如何利用LangChain平臺(含LangSmith和LangGraph)與Pay-i經濟智慧平臺結合,將工程級可觀測性連線到業務價值,從而向領導層證明AI投資回報。
Athena是Shoplazza推出的AI編排代理,旨在統一管理整個商業技術棧,簡化電商運營流程。
OpenWiki 0.2 版本增加了對 OKF(一種知識 wiki 結構化標準)的支援,使開發者能夠更好地組織和分類程式碼庫文件,提升代理檢索效率並減少令牌消耗。
Democr.ai 是一個開源的自託管代理AI執行時框架,整合了伺服器驅動UI、多客戶端渲染、多租戶、RBAC、OS級沙箱、三層審計、可插拔AI引擎編排、知識子系統等核心功能。其核心理念是“一切皆模組”,無供應商鎖定,強調安全作為原語。專案仍處於測試階段,但架構已面向生產級約束。
Cybara 是一個自託管的 AI 代理作業系統,結合了 Bun 代理執行時、Web UI、CLI、桌面應用、移動伴侶、加密錢包控制、多平臺訊息通道介面卡和 MCP 支援。它支援多代理編排、瀏覽器自動化、安全訊息傳遞和加密錢包操作,適合開發者和運營商。
根據VentureBeat Pulse Research對101家企業的調查,企業代理編排正在向模型提供商平臺集中,Anthropic的Claude以40%的使用率領先。然而,大多數部署的“代理”仍是簡單的聊天機器人包裝,真正的多步驟編排工作流僅佔少數。企業預計到2026年底採用混合控制平面以避免供應商鎖定,但即時成本控制仍不成熟。
LangChain的Fleet平臺新增一鍵部署功能,允許使用者無需編碼即可建立併發布AI代理到Slack。代理可擁有自定義身份,在頻道和執行緒中工作,並支援許可權控制和審批流程。
Atlassian 宣佈擴充套件 Jira,新增 Jira Planner、Jira Coding Agent 及第三方代理整合,旨在將 Jira 打造為開發者與 AI 代理協同工作的控制平臺,解決規劃與協調瓶頸問題。
為了讓AI智慧體真正自主執行任務,它們需要一個隔離、安全且可快速部署的計算環境。本文介紹了智慧體為何需要自己的“計算機”,以及LangSmith沙箱如何透過微虛擬機器隔離、快照與分支、認證代理和安全執行等特性滿足這一需求。同時討論了提示注入等安全風險及緩解措施。
本文介紹了七種Python工具,工程師在2026年實際使用它們來在本地基礎設施上構建、協調和執行AI代理,涵蓋從模型執行到決策編排的各個層面。
TormentNexus是一個本地優先的開源AI控制平面,為多代理工作流提供持久記憶、MCP工具編排和自主基礎設施管理。它支援38+ AI編碼代理,具有漸進式工具路由、雙層記憶架構和群集協調等功能。
本文介紹了一個基於Strands Agents和Amazon Bedrock AgentCore構建的多智慧體系統,用於自動化從潛在客戶發現到個性化郵件生成的流程。文章比較了Swarm和Graph兩種編排模式,透過頭對頭基準測試評估延遲、成本和郵件質量。系統使用四個專門智慧體、加權評分和時態衰減,並提供了生產部署的治理控制。
使用LangSmith追蹤Claude Code、Codex、Cursor、Copilot等編碼代理。檢查工具呼叫、子代理、錯誤、成本和重試。
Mnemo AI 是一個本地代理型AI助手,利用LangGraph和LangChain整合多種LLM提供商(如Ollama、Amazon Bedrock、OpenAI、Anthropic等)。它具備MCP工具系統、RAG能力、使用者檔案學習、情景記憶以及ACE劇本——一種能從成功和失敗中學習策略的機制。此外,還支援網路搜尋、影像分析、檔案操作、bash執行等功能。
本文探討了2026年開源智慧體工具包的現狀,重點分析了編排、記憶、工具協議、瀏覽器控制等關鍵層的工具選擇策略,並指出了生產環境中常見的陷阱與最佳實踐。
以同名開源資料管道和工作流編排器聞名的Prefect宣佈收購Dagster(Apache Airflow的另一大替代品)。交易完成後,Dagster和Dagster+保持原名和產品路線圖,約40名Dagster團隊成員加入Prefect。Prefect CEO Jeremiah Lowin表示,此次收購旨在為AI智慧體提供可靠執行的元件:明確目標、靈活應變以及外部系統連線。
一個基於LangChain和本地Ollama伺服器的AI代理架構教育實驗室,包含多種代理變體,涵蓋聊天記憶、工具呼叫、RAG、混合和代理RAG等類別,每個變體均可獨立執行CLI以研究其機制。
Go語言已成為雲端基礎設施的通用語言,微軟現在為其Agent Framework推出Go版本,使雲原生開發者能夠用他們熟悉的語言構建AI代理。與此同時,谷歌早已支援Go,而OpenAI和Anthropic仍未跟上。
Ypipe是一款基於Java的免費本地AI客戶端,整合了MCP編排功能,無需Python環境即可執行。它支援私有代理聊天、本地模型管理、一鍵整合,並可與SAP、Oracle等遺留系統對接,確保資料主權。提供零配置便攜性、跨平臺支援及無頭模式,適合企業級本地AI部署。
OpenWiki Brains 是 LangChain 推出的新框架,透過連線 Gmail、Notion、Git 等多種來源,為 AI 代理提供主動的 Wiki 式記憶,並自動更新本地 Wiki。
KTern.AI 利用 Amazon Bedrock AgentCore 和 Strands Agents SDK,將傳統 SaaS 平臺升級為智慧體 AI 平臺,實現了 SAP 數字化轉型的自動化。智慧體可在長時間執行的企業專案中協調工作,具備持久上下文、安全工具訪問和生產級可靠性。此方案將 SAP 專案週期縮短 45%,發現與評估時間減少 60-70%,並自主識別 90% 的財務與銷售運營異常。
瞭解如何構建一個風險投資研究代理,它能在90秒內生成帶有引用的投資備忘錄,使用Perplexity Agent API、LangGraph和LangSmith。該代理並行執行團隊、財務、產品和市場四個研究節點,然後綜合生成包含七個部分的備忘錄,包括論點與建議。每個宣告都可追溯到原始來源,確保輸出可審計。文章還比較了三個搜尋提供商,並提供了構建類似代理的要點。
比較LangChain、LlamaIndex和原始API呼叫在LLM應用中的優缺點,提供選擇抽象層級的決策框架。
追蹤 AI 編程助理、程式碼生成、IDE 外掛、開發者工作流程和軟體工程自動化。
追蹤 Model Context Protocol、工具呼叫、連接器、Agent 上下文和企業整合。
追蹤開源權重模型、開放授權、社群評測、模型蒸餾和本地部署。
追蹤推理價格、延遲、吞吐、快取、量化、服務商成本和部署效率。
追蹤中國 AI 公司、模型、政策、晶片生態、開源社群和商業化進展。
追蹤 GPU、資料中心、叢集網路、AI 雲、訓練基礎設施和供應鏈。
追蹤模型 API 價格、方案、上下文視窗、免費額度、單位 token 成本和商業模式。
追蹤 DeepSeek 模型、API、開源權重、推理效率、生態合作和全球影響。
追蹤 Qwen/通義千問模型、開源權重、多模態、Agent 能力、API 和企業落地。