AI News HubLIVE
公开文章 53采集文章 55可信度 76刷新频率 120 分钟
健康状态 健康来源类型 社区原文权限 站内改写最近入库 2026-08-09ID machine-learning-mastery运行状态 已启用

Machine learning education and applied AI source; summary-only unless authorization is obtained.

最新公开文章

待翻译:Identifying Token Costs Hiding in Your Agentic Loop

AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:But cutting your runtime token burn is just the first problem.

  • AI 服务暂时不可用,系统已先保留来源内容与降级元数据。
  • But cutting your runtime token burn is just the first problem.
站内正文

待翻译:Designing AI Agents That Can Self-Correct

AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:With the vocabulary and the failure modes in place, here's the build.

  • AI 服务暂时不可用,系统已先保留来源内容与降级元数据。
  • With the vocabulary and the failure modes in place, here's the build.
站内正文

待翻译:7 Chunking Strategies That Decide Whether Your RAG Works

AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Day 100 in production isn't really about chunking strategies anymore.

  • AI 服务暂时不可用,系统已先保留来源内容与降级元数据。
  • Day 100 in production isn't really about chunking strategies anymore.
站内正文

待翻译:Measuring Performance of Transformer Inference

AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:This chapter is divided into eight parts; they are: • Metrics for LLM Inference • Measuring a Single Request • Warmup and Synchronization • Measuring GPU Work with CUDA Events • Measuring Memory Usage • Measuring Concurrent Requests • Multiple GPUs and Multiple Machines • Cost per Token The most common inference metrics are: • Latency: How long a request takes from start to finish.

  • AI 服务暂时不可用,系统已先保留来源内容与降级元数据。
  • This chapter is divided into eight parts; they are: • Metrics for LLM Inference • Measuring a Single Request • Warmup and Synchronization • Measuring GPU Work with CUDA Events • M…
站内正文

待翻译:Static vs. Dynamic vs. Continuous Batching in LLM Inference

AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:In this article, you will learn how static, dynamic, and continuous batching work in LLM inference, and why the differences between them matter at production...

  • AI 服务暂时不可用,系统已先保留来源内容与降级元数据。
  • In this article, you will learn how static, dynamic, and continuous batching work in LLM inference, and why the differences between them matter at production...
站内正文

待翻译:Decoding Strategies and Output Control

AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:This chapter is divided into nine parts; they are: • Reading Logits from a Model • Greedy Decoding • Temperature Sampling • Top-$k$ Sampling • Nucleus Sampling • Repetition Penalties • Beam Search • Stop Conditions • Structured Output Constraints The model returns a vector of logits for every position in the input sequence.

  • AI 服务暂时不可用,系统已先保留来源内容与降级元数据。
  • This chapter is divided into nine parts; they are: • Reading Logits from a Model • Greedy Decoding • Temperature Sampling • Top-$k$ Sampling • Nucleus Sampling • Repetition Penalt…
站内正文

待翻译:Using a Transformer Model: From Training to Inference

AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:This chapter is divided into four parts; they are: • Autoregressive Generation • Prefill and Decode • A Simple KV Cache • Memory Usage of the KV Cache A decoder-only transformer model predicts the next token from the tokens that came before it.

  • AI 服务暂时不可用,系统已先保留来源内容与降级元数据。
  • This chapter is divided into four parts; they are: • Autoregressive Generation • Prefill and Decode • A Simple KV Cache • Memory Usage of the KV Cache A decoder-only transformer m…
站内正文

待翻译:The End-to-End Agentic AI Pipeline

AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:In this article, you will learn the seven architectural components that separate a production-grade agentic AI system from a demo script, and how each one...

  • AI 服务暂时不可用,系统已先保留来源内容与降级元数据。
  • In this article, you will learn the seven architectural components that separate a production-grade agentic AI system from a demo script, and how each one...
站内正文

待翻译:Ollama vs. LM Studio vs. llama.cpp: Which Local AI Runtime Should You Use in 2026?

AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:In this article, you will learn how Ollama, LM Studio, and llama.cpp differ across the dimensions that matter most to practitioners, and how to choose...

  • AI 服务暂时不可用,系统已先保留来源内容与降级元数据。
  • In this article, you will learn how Ollama, LM Studio, and llama.cpp differ across the dimensions that matter most to practitioners, and how to choose...
站内正文

AI智能体持久化内存与状态的五种架构模式

本文介绍了AI智能体中处理持久化内存和状态的五种架构模式,包括:上下文工作缓冲区、执行检查点、语义记忆、事件日志和多范围隔离。这些模式帮助智能体在长时间运行中保持状态一致性、故障恢复能力、跨会话知识持久化、历史反思学习以及多租户数据隐私。

  • 区分状态(当前任务快照)和记忆(跨边界信息传递)是关键。
  • 五种模式分别处理短期执行、故障恢复、跨会话知识、历史反思和隐私隔离。
站内正文

有状态 vs 无状态代理设计:可扩展代理系统的权衡

本文探讨了AI代理中状态管理的两种范式——无状态和有状态设计,分析了各自的扩展性权衡,并通过Groq API的代码示例说明了实现方式。无状态代理易于水平扩展但需客户端传递完整对话历史,有状态代理通过数据库管理内存但增加架构复杂性。

  • 无状态代理每个请求独立,可轻松水平扩展,但多轮对话需前端重发全部历史,导致令牌消耗增长。
  • 有状态代理自行管理会话历史,客户端只需发送新提示和会话ID,便于复杂工作流,但需数据库层和缓存策略以支持扩展。
站内正文

循环工程入门

循环工程是设计自主AI代理循环的实践,使其无需持续人工干预即可可靠运行。该概念在2026年6月迅速崛起,建立在ReAct(2022)和Reflexion(2023)等研究基础之上,是提示工程、上下文工程和框架工程之后的又一发展。本文探讨了循环工程的定义、起源、解剖结构以及构建可靠循环的挑战。

  • 循环工程涉及为AI代理设计自主循环,取代逐轮人工提示。
  • 它在2026年6月因Peter Steinberger和Addy Osmani的帖子而兴起,多年研究为其支撑。
站内正文

自主AI的当前状态

到2026年中,自主AI架构已演进,原生推理模型取代了编排循环,多智能体蜂群和通过MCP标准化的工具协议成为主流。本文涵盖如何设计无状态专业智能体、记忆图和安全模式。

  • 原生推理模型使复杂的外部编排框架变得多余。
  • 通过交接工具连接无状态专业智能体的多智能体蜂群。
站内正文

使用LangGraph在Python中构建智能体工作流

本文详细介绍了如何使用LangGraph在Python中构建完整的智能体工作流,从单次模型调用到具有持久对话记忆的工具使用智能体。涵盖了状态、节点、边的定义,消息历史管理,模型调用,工具注册与路由,以及推理循环追踪。

  • LangGraph将智能体表示为图结构,节点为工作单元,边定义执行顺序,共享状态对象携带完整消息历史。
  • 通过MessagesState自动管理对话历史,使用add_messages归约器实现消息累积。
站内正文

代理AI安全:防御提示注入与工具滥用

本文探讨了代理AI系统中的提示注入和工具滥用威胁,并介绍了专家推荐的五大防御策略,包括最小权限原则、开源护栏、沙箱执行、人机协同检查点以及监控审计。

  • 提示注入和工具滥用是代理AI的主要安全威胁,可能导致目标劫持和权限滥用。
  • 传统安全机制无法有效防御具有自主推理能力的AI系统。
站内正文

15分钟内用Ollama运行本地AI模型

本文教你如何使用Ollama在15分钟内本地运行小型语言模型,涵盖安装、下载模型、对话、量化及故障诊断。

  • Ollama简化了本地AI模型的部署,三步即可开始对话。
  • 模型量化使3B参数模型仅需约2GB下载空间和较低内存。
站内正文

Scikit-Ollama:将Scikit-Learn与本地Ollama模型集成进行零样本文本分类

本文介绍了scikit-ollama库,它通过将本地运行的Ollama模型与scikit-learn接口相结合,实现了零样本文本分类,无需云API。文章详细说明了如何设置环境、加载数据集、实例化分类器以及执行拟合和预测,并强调了该方法的成本效益和数据隐私优势。

  • scikit-ollama基于scikit-llm,将本地Ollama模型集成到scikit-learn工作流中。
  • 使用本地Llama 3模型进行电影评论情感分类,无需云API。
站内正文

LLM评估框架比较:如何真正衡量模型性能

比较三种开源LLM评估框架——RAGAS、DeepEval和Promptfoo,详细说明它们的用途、适用场景以及理解LLM作为评判者的偏差的重要性。包括忠诚度检查和CI门控评估的代码演示。

  • RAGAS专注于RAG特定评分,具有学术级指标;DeepEval基于pytest,适用于CI/CD质量门控;Promptfoo擅长多模型比较和红队测试。
  • 常见指标包括忠诚度、上下文精确度/召回率、答案相关性和G-Eval。
站内正文

构建AI代理?以下是应避免的反模式。

本文详细介绍了AI代理项目中导致失败的架构和操作反模式,包括过早采用多代理系统、工具扩散、硬编码逻辑、缺乏记忆设计、缺少可观测性、无管控的写权限、上下文漂移以及跳过评估。作者强调了从简单开始、构建可观测性、仅在能衡量回报时增加复杂性的重要性。

  • AI代理失败通常源于架构和设计错误,而非模型问题。
  • 过早使用多代理架构会增加协调开销,建议从单一代理开始。
站内正文

LLM编排框架对比:LangChain vs. LlamaIndex vs. 原始API调用

比较LangChain、LlamaIndex和原始API调用在LLM应用中的优缺点,提供选择抽象层级的决策框架。

  • LangChain是通用编排工具,适合复杂工作流和代理,但可能带来开销和调试难度。
  • LlamaIndex专注于检索增强生成(RAG),擅长数据摄入和索引。
站内正文

工具与子代理:构建有效AI代理而不过度工程化

本文探讨了在构建AI代理时如何决定将功能实现为工具还是子代理,以及如何避免过度工程化。工具执行代码,子代理执行推理。文章提供了一个简单的三问决策框架,并分析了引入子代理的实际成本。

  • 工具是确定性执行的操作如API调用,子代理是独立的推理循环。
  • 使用工具当任务定义明确、不需要多步推理;使用子代理当任务需要复杂推理、上下文隔离或并行执行。
站内正文

AI代理工具选择完全指南

当AI代理的工具数量增长时,准确率会下降。本文分析了“丢失在中间”效应和工具幻觉问题,并介绍了六种实用技术:门控、检索、路由、规划、回退逻辑与基准测试,帮助在规模扩展中保持工具选择的高效与准确。

  • 工具数量超过15-20个时,代理准确率显著下降,问题源于上下文拥挤和注意力分散。
  • 门控机制快速过滤无需调用工具的对话轮次,降低延迟与成本。
站内正文

Agentic AI系统中的上下文工程与记忆工程

本文探讨了上下文工程和记忆工程在Agentic AI系统中的区别与联系。上下文工程关注单次推理调用中的信息选择、压缩和放置,而记忆工程则涉及跨调用、跨会话的持久化信息管理。两者在检索边界交汇,管理不善会导致检索信息冗余或上下文污染。

  • 上下文工程决定单次推理调用中的信息构成与排列,影响推理质量。
  • 记忆工程涵盖写入策略、存储后端、检索机制和维护策略,塑造长期可靠性。
站内正文

长时间运行代理的上下文窗口管理:策略与权衡

本文介绍了五种管理长时间运行AI代理应用上下文窗口的实用策略,包括滑动窗口、递归总结、结构化状态管理、通过RAG的临时上下文和动态上下文路由,并分析了每种策略的内在权衡。

  • 滑动窗口简单快速但会导致数字失忆。
  • 递归总结通过压缩历史保持长期记忆但丢失细节。
站内正文

模型上下文协议(MCP)三种难度级别详解

Model Context Protocol(MCP)是Anthropic推出的开放标准,旨在统一AI应用与外部工具、数据源的通信方式。本文从三个递进层次解析MCP:为何需要该协议、架构与请求流程、以及生产环境中的传输、安全与部署考量。

  • MCP通过标准协议替代M×N个定制适配器,将集成复杂度降为M+N。
  • 架构包含宿主(Host)、客户端(Client)和服务器(Server),三者协作完成请求。
站内正文

AI智能体技术栈解析

本文深入解析生产级AI智能体的七层技术栈,从基础模型到部署基础设施。涵盖每层功能、代码实现示例,以及不同场景(原型、初创、企业)的技术选型建议。

  • AI智能体由七层技术组成:基础模型、编排框架、记忆系统、检索增强生成(RAG)、工具、可观测性与部署。
  • 基础模型提供推理核心,主流选择包括GPT-5.5、Claude Sonnet 4.6、Gemini 3.1 Pro及开源模型。
站内正文

代理工作流与自主代理:有什么区别?

本文通过聚焦控制流的归属——是人类预先编写代码,还是模型在运行时推理——来区分代理工作流和自主代理。涵盖了确定性工作流、编排工作流、反应式代理和自主多智能体系统,并提供了可运行的代码示例。文章指出,真正的轴心是可预测性与自主性,而非是否使用LLM。在生产中,工作流(而非完全自主的代理)占据主导地位,而混合架构是实际有效的模式。

  • 核心区别在于控制流的归属:人类编写的固定路径 vs 模型在运行时动态决定路径。
  • 确定性工作流路径固定;编排工作流有预设分支;反应式代理(ReAct循环)在运行时决定步骤序列;自主多智能体系统则嵌套多个ReAct循环。
站内正文

上下文窗口并非记忆:AI智能体开发者需要理解的关键点

本文解释了为什么大上下文窗口不等于智能体记忆,并介绍了检索、压缩和摘要技术如何在智能体的认知栈中协同工作,从而实现真正的记忆持久化。

  • 上下文窗口是临时工作区,不是持久记忆,模型是无状态的。
  • 检索增强生成(RAG)可能引入矛盾,需要时间戳优先级解决。
站内正文

使用LLM嵌入和HDBSCAN对非结构化文本进行聚类

本文介绍了如何结合大语言模型嵌入和HDBSCAN密度聚类算法,构建文本聚类管道,自动发现未标注文本数据中的主题。包括使用预训练模型生成嵌入、UMAP降维、HDBSCAN聚类及可视化。

  • 使用sentence-transformers生成文本嵌入
  • 通过UMAP将嵌入降维至5维
站内正文

用Python构建能使用浏览器的AI代理

本文介绍了如何使用Playwright、browser-use和LangGraph在Python中构建能浏览和操作真实网站的AI代理。文章涵盖了Playwright相较于Selenium的优势(持久WebSocket连接、内置浏览器二进制、自动等待等)、环境搭建步骤、动态页面抓取、多步骤表单填写、反爬虫处理、会话持久化以及Docker部署。通过实际代码示例,读者将学会构建一个能导航网站、填写表单、提取结构化数据并通过LLM决策的浏览器代理。

  • Playwright通过持久WebSocket连接实现比Selenium快30-50%的浏览器操作,并内置自动等待和真实鼠标/键盘事件。
  • 环境搭建仅需Python 3.10+、OpenAI API密钥和几个pip安装命令,包括Playwright浏览器二进制文件。
站内正文

全部来源