AI News HubLIVE
公開文章 53採集文章 55可信度 76刷新頻率 120 分鐘
健康狀態 健康來源類型 社群原文權限 站內改寫最近入庫 2026-08-09ID machine-learning-mastery運行狀態 已啟用

Machine learning education and applied AI source; summary-only unless authorization is obtained.

最新公開文章

待翻譯:Identifying Token Costs Hiding in Your Agentic Loop

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:But cutting your runtime token burn is just the first problem.

  • AI 服務暫時不可用,系統已先保留來源內容與降級元數據。
  • But cutting your runtime token burn is just the first problem.
站內正文

待翻譯:Designing AI Agents That Can Self-Correct

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:With the vocabulary and the failure modes in place, here's the build.

  • AI 服務暫時不可用,系統已先保留來源內容與降級元數據。
  • With the vocabulary and the failure modes in place, here's the build.
站內正文

待翻譯:7 Chunking Strategies That Decide Whether Your RAG Works

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Day 100 in production isn't really about chunking strategies anymore.

  • AI 服務暫時不可用,系統已先保留來源內容與降級元數據。
  • Day 100 in production isn't really about chunking strategies anymore.
站內正文

待翻譯:Measuring Performance of Transformer Inference

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:This chapter is divided into eight parts; they are: • Metrics for LLM Inference • Measuring a Single Request • Warmup and Synchronization • Measuring GPU Work with CUDA Events • Measuring Memory Usage • Measuring Concurrent Requests • Multiple GPUs and Multiple Machines • Cost per Token The most common inference metrics are: • Latency: How long a request takes from start to finish.

  • AI 服務暫時不可用,系統已先保留來源內容與降級元數據。
  • This chapter is divided into eight parts; they are: • Metrics for LLM Inference • Measuring a Single Request • Warmup and Synchronization • Measuring GPU Work with CUDA Events • M…
站內正文

待翻譯:Static vs. Dynamic vs. Continuous Batching in LLM Inference

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:In this article, you will learn how static, dynamic, and continuous batching work in LLM inference, and why the differences between them matter at production...

  • AI 服務暫時不可用,系統已先保留來源內容與降級元數據。
  • In this article, you will learn how static, dynamic, and continuous batching work in LLM inference, and why the differences between them matter at production...
站內正文

待翻譯:Decoding Strategies and Output Control

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:This chapter is divided into nine parts; they are: • Reading Logits from a Model • Greedy Decoding • Temperature Sampling • Top-$k$ Sampling • Nucleus Sampling • Repetition Penalties • Beam Search • Stop Conditions • Structured Output Constraints The model returns a vector of logits for every position in the input sequence.

  • AI 服務暫時不可用,系統已先保留來源內容與降級元數據。
  • This chapter is divided into nine parts; they are: • Reading Logits from a Model • Greedy Decoding • Temperature Sampling • Top-$k$ Sampling • Nucleus Sampling • Repetition Penalt…
站內正文

待翻譯:Using a Transformer Model: From Training to Inference

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:This chapter is divided into four parts; they are: • Autoregressive Generation • Prefill and Decode • A Simple KV Cache • Memory Usage of the KV Cache A decoder-only transformer model predicts the next token from the tokens that came before it.

  • AI 服務暫時不可用,系統已先保留來源內容與降級元數據。
  • This chapter is divided into four parts; they are: • Autoregressive Generation • Prefill and Decode • A Simple KV Cache • Memory Usage of the KV Cache A decoder-only transformer m…
站內正文

待翻譯:The End-to-End Agentic AI Pipeline

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:In this article, you will learn the seven architectural components that separate a production-grade agentic AI system from a demo script, and how each one...

  • AI 服務暫時不可用,系統已先保留來源內容與降級元數據。
  • In this article, you will learn the seven architectural components that separate a production-grade agentic AI system from a demo script, and how each one...
站內正文

待翻譯:Ollama vs. LM Studio vs. llama.cpp: Which Local AI Runtime Should You Use in 2026?

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:In this article, you will learn how Ollama, LM Studio, and llama.cpp differ across the dimensions that matter most to practitioners, and how to choose...

  • AI 服務暫時不可用,系統已先保留來源內容與降級元數據。
  • In this article, you will learn how Ollama, LM Studio, and llama.cpp differ across the dimensions that matter most to practitioners, and how to choose...
站內正文

AI智能體持久化內存與狀態的五種架構模式

本文介紹了AI智能體中處理持久化內存和狀態的五種架構模式,包括:上下文工作緩衝區、執行檢查點、語義記憶、事件日誌和多範圍隔離。這些模式幫助智能體在長時間運行中保持狀態一致性、故障恢復能力、跨會話知識持久化、歷史反思學習以及多租户數據隱私。

  • 區分狀態(當前任務快照)和記憶(跨邊界信息傳遞)是關鍵。
  • 五種模式分別處理短期執行、故障恢復、跨會話知識、歷史反思和隱私隔離。
站內正文

有狀態 vs 無狀態代理設計:可擴展代理系統的權衡

本文探討了AI代理中狀態管理的兩種範式——無狀態和有狀態設計,分析了各自的擴展性權衡,並通過Groq API的代碼示例説明了實現方式。無狀態代理易於水平擴展但需客户端傳遞完整對話歷史,有狀態代理通過數據庫管理內存但增加架構複雜性。

  • 無狀態代理每個請求獨立,可輕鬆水平擴展,但多輪對話需前端重發全部歷史,導致令牌消耗增長。
  • 有狀態代理自行管理會話歷史,客户端只需發送新提示和會話ID,便於複雜工作流,但需數據庫層和緩存策略以支持擴展。
站內正文

循環工程入門

循環工程是設計自主AI代理循環的實踐,使其無需持續人工干預即可可靠運行。該概念在2026年6月迅速崛起,建立在ReAct(2022)和Reflexion(2023)等研究基礎之上,是提示工程、上下文工程和框架工程之後的又一發展。本文探討了循環工程的定義、起源、解剖結構以及構建可靠循環的挑戰。

  • 循環工程涉及為AI代理設計自主循環,取代逐輪人工提示。
  • 它在2026年6月因Peter Steinberger和Addy Osmani的帖子而興起,多年研究為其支撐。
站內正文

自主AI的當前狀態

到2026年中,自主AI架構已演進,原生推理模型取代了編排循環,多智能體蜂羣和通過MCP標準化的工具協議成為主流。本文涵蓋如何設計無狀態專業智能體、記憶圖和安全模式。

  • 原生推理模型使複雜的外部編排框架變得多餘。
  • 通過交接工具連接無狀態專業智能體的多智能體蜂羣。
站內正文

使用LangGraph在Python中構建智能體工作流

本文詳細介紹瞭如何使用LangGraph在Python中構建完整的智能體工作流,從單次模型調用到具有持久對話記憶的工具使用智能體。涵蓋了狀態、節點、邊的定義,消息歷史管理,模型調用,工具註冊與路由,以及推理循環追蹤。

  • LangGraph將智能體表示為圖結構,節點為工作單元,邊定義執行順序,共享狀態對象攜帶完整消息歷史。
  • 通過MessagesState自動管理對話歷史,使用add_messages歸約器實現消息累積。
站內正文

代理AI安全:防禦提示注入與工具濫用

本文探討了代理AI系統中的提示注入和工具濫用威脅,並介紹了專家推薦的五大防禦策略,包括最小權限原則、開源護欄、沙箱執行、人機協同檢查點以及監控審計。

  • 提示注入和工具濫用是代理AI的主要安全威脅,可能導致目標劫持和權限濫用。
  • 傳統安全機制無法有效防禦具有自主推理能力的AI系統。
站內正文

15分鐘內用Ollama運行本地AI模型

本文教你如何使用Ollama在15分鐘內本地運行小型語言模型,涵蓋安裝、下載模型、對話、量化及故障診斷。

  • Ollama簡化了本地AI模型的部署,三步即可開始對話。
  • 模型量化使3B參數模型僅需約2GB下載空間和較低內存。
站內正文

Scikit-Ollama:將Scikit-Learn與本地Ollama模型集成進行零樣本文本分類

本文介紹了scikit-ollama庫,它通過將本地運行的Ollama模型與scikit-learn接口相結合,實現了零樣本文本分類,無需雲API。文章詳細説明了如何設置環境、加載數據集、實例化分類器以及執行擬合和預測,並強調了該方法的成本效益和數據隱私優勢。

  • scikit-ollama基於scikit-llm,將本地Ollama模型集成到scikit-learn工作流中。
  • 使用本地Llama 3模型進行電影評論情感分類,無需雲API。
站內正文

LLM評估框架比較:如何真正衡量模型性能

比較三種開源LLM評估框架——RAGAS、DeepEval和Promptfoo,詳細説明它們的用途、適用場景以及理解LLM作為評判者的偏差的重要性。包括忠誠度檢查和CI門控評估的代碼演示。

  • RAGAS專注於RAG特定評分,具有學術級指標;DeepEval基於pytest,適用於CI/CD質量門控;Promptfoo擅長多模型比較和紅隊測試。
  • 常見指標包括忠誠度、上下文精確度/召回率、答案相關性和G-Eval。
站內正文

構建AI代理?以下是應避免的反模式。

本文詳細介紹了AI代理項目中導致失敗的架構和操作反模式,包括過早採用多代理系統、工具擴散、硬編碼邏輯、缺乏記憶設計、缺少可觀測性、無管控的寫權限、上下文漂移以及跳過評估。作者強調了從簡單開始、構建可觀測性、僅在能衡量回報時增加複雜性的重要性。

  • AI代理失敗通常源於架構和設計錯誤,而非模型問題。
  • 過早使用多代理架構會增加協調開銷,建議從單一代理開始。
站內正文

LLM編排框架對比:LangChain vs. LlamaIndex vs. 原始API調用

比較LangChain、LlamaIndex和原始API調用在LLM應用中的優缺點,提供選擇抽象層級的決策框架。

  • LangChain是通用編排工具,適合複雜工作流和代理,但可能帶來開銷和調試難度。
  • LlamaIndex專注於檢索增強生成(RAG),擅長數據攝入和索引。
站內正文

工具與子代理:構建有效AI代理而不過度工程化

本文探討了在構建AI代理時如何決定將功能實現為工具還是子代理,以及如何避免過度工程化。工具執行代碼,子代理執行推理。文章提供了一個簡單的三問決策框架,並分析了引入子代理的實際成本。

  • 工具是確定性執行的操作如API調用,子代理是獨立的推理循環。
  • 使用工具當任務定義明確、不需要多步推理;使用子代理當任務需要複雜推理、上下文隔離或並行執行。
站內正文

AI代理工具選擇完全指南

當AI代理的工具數量增長時,準確率會下降。本文分析了“丟失在中間”效應和工具幻覺問題,並介紹了六種實用技術:門控、檢索、路由、規劃、回退邏輯與基準測試,幫助在規模擴展中保持工具選擇的高效與準確。

  • 工具數量超過15-20個時,代理準確率顯著下降,問題源於上下文擁擠和注意力分散。
  • 門控機制快速過濾無需調用工具的對話輪次,降低延遲與成本。
站內正文

Agentic AI系統中的上下文工程與記憶工程

本文探討了上下文工程和記憶工程在Agentic AI系統中的區別與聯繫。上下文工程關注單次推理調用中的信息選擇、壓縮和放置,而記憶工程則涉及跨調用、跨會話的持久化信息管理。兩者在檢索邊界交匯,管理不善會導致檢索信息冗餘或上下文污染。

  • 上下文工程決定單次推理調用中的信息構成與排列,影響推理質量。
  • 記憶工程涵蓋寫入策略、存儲後端、檢索機制和維護策略,塑造長期可靠性。
站內正文

長時間運行代理的上下文窗口管理:策略與權衡

本文介紹了五種管理長時間運行AI代理應用上下文窗口的實用策略,包括滑動窗口、遞歸總結、結構化狀態管理、通過RAG的臨時上下文和動態上下文路由,並分析了每種策略的內在權衡。

  • 滑動窗口簡單快速但會導致數字失憶。
  • 遞歸總結通過壓縮歷史保持長期記憶但丟失細節。
站內正文

模型上下文協議(MCP)三種難度級別詳解

Model Context Protocol(MCP)是Anthropic推出的開放標準,旨在統一AI應用與外部工具、數據源的通信方式。本文從三個遞進層次解析MCP:為何需要該協議、架構與請求流程、以及生產環境中的傳輸、安全與部署考量。

  • MCP通過標準協議替代M×N個定製適配器,將集成複雜度降為M+N。
  • 架構包含宿主(Host)、客户端(Client)和服務器(Server),三者協作完成請求。
站內正文

AI智能體技術棧解析

本文深入解析生產級AI智能體的七層技術棧,從基礎模型到部署基礎設施。涵蓋每層功能、代碼實現示例,以及不同場景(原型、初創、企業)的技術選型建議。

  • AI智能體由七層技術組成:基礎模型、編排框架、記憶系統、檢索增強生成(RAG)、工具、可觀測性與部署。
  • 基礎模型提供推理核心,主流選擇包括GPT-5.5、Claude Sonnet 4.6、Gemini 3.1 Pro及開源模型。
站內正文

代理工作流與自主代理:有什麼區別?

本文通過聚焦控制流的歸屬——是人類預先編寫代碼,還是模型在運行時推理——來區分代理工作流和自主代理。涵蓋了確定性工作流、編排工作流、反應式代理和自主多智能體系統,並提供了可運行的代碼示例。文章指出,真正的軸心是可預測性與自主性,而非是否使用LLM。在生產中,工作流(而非完全自主的代理)佔據主導地位,而混合架構是實際有效的模式。

  • 核心區別在於控制流的歸屬:人類編寫的固定路徑 vs 模型在運行時動態決定路徑。
  • 確定性工作流路徑固定;編排工作流有預設分支;反應式代理(ReAct循環)在運行時決定步驟序列;自主多智能體系統則嵌套多個ReAct循環。
站內正文

上下文窗口並非記憶:AI智能體開發者需要理解的關鍵點

本文解釋了為什麼大上下文窗口不等於智能體記憶,並介紹了檢索、壓縮和摘要技術如何在智能體的認知棧中協同工作,從而實現真正的記憶持久化。

  • 上下文窗口是臨時工作區,不是持久記憶,模型是無狀態的。
  • 檢索增強生成(RAG)可能引入矛盾,需要時間戳優先級解決。
站內正文

使用LLM嵌入和HDBSCAN對非結構化文本進行聚類

本文介紹瞭如何結合大語言模型嵌入和HDBSCAN密度聚類算法,構建文本聚類管道,自動發現未標註文本數據中的主題。包括使用預訓練模型生成嵌入、UMAP降維、HDBSCAN聚類及可視化。

  • 使用sentence-transformers生成文本嵌入
  • 通過UMAP將嵌入降維至5維
站內正文

用Python構建能使用瀏覽器的AI代理

本文介紹瞭如何使用Playwright、browser-use和LangGraph在Python中構建能瀏覽和操作真實網站的AI代理。文章涵蓋了Playwright相較於Selenium的優勢(持久WebSocket連接、內置瀏覽器二進制、自動等待等)、環境搭建步驟、動態頁面抓取、多步驟表單填寫、反爬蟲處理、會話持久化以及Docker部署。通過實際代碼示例,讀者將學會構建一個能導航網站、填寫表單、提取結構化數據並通過LLM決策的瀏覽器代理。

  • Playwright通過持久WebSocket連接實現比Selenium快30-50%的瀏覽器操作,並內置自動等待和真實鼠標/鍵盤事件。
  • 環境搭建僅需Python 3.10+、OpenAI API密鑰和幾個pip安裝命令,包括Playwright瀏覽器二進制文件。
站內正文

全部來源