待翻译:Identifying Token Costs Hiding in Your Agentic Loop
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:But cutting your runtime token burn is just the first problem.
- AI 服务暂时不可用,系统已先保留来源内容与降级元数据。
- But cutting your runtime token burn is just the first problem.
来源详情
AI News Hub 持续跟踪 Machine Learning Mastery 的 AI 更新,并公开来源状态、授权边界、抓取方式和已发布文章。
Machine learning education and applied AI source; summary-only unless authorization is obtained.
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:But cutting your runtime token burn is just the first problem.
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:With the vocabulary and the failure modes in place, here's the build.
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:Day 100 in production isn't really about chunking strategies anymore.
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:This chapter is divided into eight parts; they are: • Metrics for LLM Inference • Measuring a Single Request • Warmup and Synchronization • Measuring GPU Work with CUDA Events • Measuring Memory Usage • Measuring Concurrent Requests • Multiple GPUs and Multiple Machines • Cost per Token The most common inference metrics are: • Latency: How long a request takes from start to finish.
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:In this article, you will learn how static, dynamic, and continuous batching work in LLM inference, and why the differences between them matter at production...
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:This chapter is divided into nine parts; they are: • Reading Logits from a Model • Greedy Decoding • Temperature Sampling • Top-$k$ Sampling • Nucleus Sampling • Repetition Penalties • Beam Search • Stop Conditions • Structured Output Constraints The model returns a vector of logits for every position in the input sequence.
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:This chapter is divided into four parts; they are: • Autoregressive Generation • Prefill and Decode • A Simple KV Cache • Memory Usage of the KV Cache A decoder-only transformer model predicts the next token from the tokens that came before it.
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:In this article, you will learn the seven architectural components that separate a production-grade agentic AI system from a demo script, and how each one...
AI 服务暂时不可用,以下为来源摘要,待恢复后补全翻译:In this article, you will learn how Ollama, LM Studio, and llama.cpp differ across the dimensions that matter most to practitioners, and how to choose...
本文介绍了AI智能体中处理持久化内存和状态的五种架构模式,包括:上下文工作缓冲区、执行检查点、语义记忆、事件日志和多范围隔离。这些模式帮助智能体在长时间运行中保持状态一致性、故障恢复能力、跨会话知识持久化、历史反思学习以及多租户数据隐私。
本文探讨了AI代理中状态管理的两种范式——无状态和有状态设计,分析了各自的扩展性权衡,并通过Groq API的代码示例说明了实现方式。无状态代理易于水平扩展但需客户端传递完整对话历史,有状态代理通过数据库管理内存但增加架构复杂性。
循环工程是设计自主AI代理循环的实践,使其无需持续人工干预即可可靠运行。该概念在2026年6月迅速崛起,建立在ReAct(2022)和Reflexion(2023)等研究基础之上,是提示工程、上下文工程和框架工程之后的又一发展。本文探讨了循环工程的定义、起源、解剖结构以及构建可靠循环的挑战。
到2026年中,自主AI架构已演进,原生推理模型取代了编排循环,多智能体蜂群和通过MCP标准化的工具协议成为主流。本文涵盖如何设计无状态专业智能体、记忆图和安全模式。
本文详细介绍了如何使用LangGraph在Python中构建完整的智能体工作流,从单次模型调用到具有持久对话记忆的工具使用智能体。涵盖了状态、节点、边的定义,消息历史管理,模型调用,工具注册与路由,以及推理循环追踪。
本文探讨了代理AI系统中的提示注入和工具滥用威胁,并介绍了专家推荐的五大防御策略,包括最小权限原则、开源护栏、沙箱执行、人机协同检查点以及监控审计。
本文教你如何使用Ollama在15分钟内本地运行小型语言模型,涵盖安装、下载模型、对话、量化及故障诊断。
本文介绍了scikit-ollama库,它通过将本地运行的Ollama模型与scikit-learn接口相结合,实现了零样本文本分类,无需云API。文章详细说明了如何设置环境、加载数据集、实例化分类器以及执行拟合和预测,并强调了该方法的成本效益和数据隐私优势。
比较三种开源LLM评估框架——RAGAS、DeepEval和Promptfoo,详细说明它们的用途、适用场景以及理解LLM作为评判者的偏差的重要性。包括忠诚度检查和CI门控评估的代码演示。
本文详细介绍了AI代理项目中导致失败的架构和操作反模式,包括过早采用多代理系统、工具扩散、硬编码逻辑、缺乏记忆设计、缺少可观测性、无管控的写权限、上下文漂移以及跳过评估。作者强调了从简单开始、构建可观测性、仅在能衡量回报时增加复杂性的重要性。
比较LangChain、LlamaIndex和原始API调用在LLM应用中的优缺点,提供选择抽象层级的决策框架。
本文探讨了在构建AI代理时如何决定将功能实现为工具还是子代理,以及如何避免过度工程化。工具执行代码,子代理执行推理。文章提供了一个简单的三问决策框架,并分析了引入子代理的实际成本。
当AI代理的工具数量增长时,准确率会下降。本文分析了“丢失在中间”效应和工具幻觉问题,并介绍了六种实用技术:门控、检索、路由、规划、回退逻辑与基准测试,帮助在规模扩展中保持工具选择的高效与准确。
本文探讨了上下文工程和记忆工程在Agentic AI系统中的区别与联系。上下文工程关注单次推理调用中的信息选择、压缩和放置,而记忆工程则涉及跨调用、跨会话的持久化信息管理。两者在检索边界交汇,管理不善会导致检索信息冗余或上下文污染。
本文介绍了五种管理长时间运行AI代理应用上下文窗口的实用策略,包括滑动窗口、递归总结、结构化状态管理、通过RAG的临时上下文和动态上下文路由,并分析了每种策略的内在权衡。
Model Context Protocol(MCP)是Anthropic推出的开放标准,旨在统一AI应用与外部工具、数据源的通信方式。本文从三个递进层次解析MCP:为何需要该协议、架构与请求流程、以及生产环境中的传输、安全与部署考量。
本文深入解析生产级AI智能体的七层技术栈,从基础模型到部署基础设施。涵盖每层功能、代码实现示例,以及不同场景(原型、初创、企业)的技术选型建议。
本文通过聚焦控制流的归属——是人类预先编写代码,还是模型在运行时推理——来区分代理工作流和自主代理。涵盖了确定性工作流、编排工作流、反应式代理和自主多智能体系统,并提供了可运行的代码示例。文章指出,真正的轴心是可预测性与自主性,而非是否使用LLM。在生产中,工作流(而非完全自主的代理)占据主导地位,而混合架构是实际有效的模式。
本文解释了为什么大上下文窗口不等于智能体记忆,并介绍了检索、压缩和摘要技术如何在智能体的认知栈中协同工作,从而实现真正的记忆持久化。
本文介绍了如何结合大语言模型嵌入和HDBSCAN密度聚类算法,构建文本聚类管道,自动发现未标注文本数据中的主题。包括使用预训练模型生成嵌入、UMAP降维、HDBSCAN聚类及可视化。
本文介绍了如何使用Playwright、browser-use和LangGraph在Python中构建能浏览和操作真实网站的AI代理。文章涵盖了Playwright相较于Selenium的优势(持久WebSocket连接、内置浏览器二进制、自动等待等)、环境搭建步骤、动态页面抓取、多步骤表单填写、反爬虫处理、会话持久化以及Docker部署。通过实际代码示例,读者将学会构建一个能导航网站、填写表单、提取结构化数据并通过LLM决策的浏览器代理。