待翻譯:Identifying Token Costs Hiding in Your Agentic Loop
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:But cutting your runtime token burn is just the first problem.
- AI 服務暫時不可用,系統已先保留來源內容與降級元數據。
- But cutting your runtime token burn is just the first problem.
來源詳情
AI News Hub 持續追蹤 Machine Learning Mastery 的 AI 更新,並公開來源狀態、授權邊界、抓取方式和已發布文章。
Machine learning education and applied AI source; summary-only unless authorization is obtained.
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:But cutting your runtime token burn is just the first problem.
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:With the vocabulary and the failure modes in place, here's the build.
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Day 100 in production isn't really about chunking strategies anymore.
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:This chapter is divided into eight parts; they are: • Metrics for LLM Inference • Measuring a Single Request • Warmup and Synchronization • Measuring GPU Work with CUDA Events • Measuring Memory Usage • Measuring Concurrent Requests • Multiple GPUs and Multiple Machines • Cost per Token The most common inference metrics are: • Latency: How long a request takes from start to finish.
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:In this article, you will learn how static, dynamic, and continuous batching work in LLM inference, and why the differences between them matter at production...
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:This chapter is divided into nine parts; they are: • Reading Logits from a Model • Greedy Decoding • Temperature Sampling • Top-$k$ Sampling • Nucleus Sampling • Repetition Penalties • Beam Search • Stop Conditions • Structured Output Constraints The model returns a vector of logits for every position in the input sequence.
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:This chapter is divided into four parts; they are: • Autoregressive Generation • Prefill and Decode • A Simple KV Cache • Memory Usage of the KV Cache A decoder-only transformer model predicts the next token from the tokens that came before it.
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:In this article, you will learn the seven architectural components that separate a production-grade agentic AI system from a demo script, and how each one...
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:In this article, you will learn how Ollama, LM Studio, and llama.cpp differ across the dimensions that matter most to practitioners, and how to choose...
本文介紹了AI智能體中處理持久化內存和狀態的五種架構模式,包括:上下文工作緩衝區、執行檢查點、語義記憶、事件日誌和多範圍隔離。這些模式幫助智能體在長時間運行中保持狀態一致性、故障恢復能力、跨會話知識持久化、歷史反思學習以及多租户數據隱私。
本文探討了AI代理中狀態管理的兩種範式——無狀態和有狀態設計,分析了各自的擴展性權衡,並通過Groq API的代碼示例説明了實現方式。無狀態代理易於水平擴展但需客户端傳遞完整對話歷史,有狀態代理通過數據庫管理內存但增加架構複雜性。
循環工程是設計自主AI代理循環的實踐,使其無需持續人工干預即可可靠運行。該概念在2026年6月迅速崛起,建立在ReAct(2022)和Reflexion(2023)等研究基礎之上,是提示工程、上下文工程和框架工程之後的又一發展。本文探討了循環工程的定義、起源、解剖結構以及構建可靠循環的挑戰。
到2026年中,自主AI架構已演進,原生推理模型取代了編排循環,多智能體蜂羣和通過MCP標準化的工具協議成為主流。本文涵蓋如何設計無狀態專業智能體、記憶圖和安全模式。
本文詳細介紹瞭如何使用LangGraph在Python中構建完整的智能體工作流,從單次模型調用到具有持久對話記憶的工具使用智能體。涵蓋了狀態、節點、邊的定義,消息歷史管理,模型調用,工具註冊與路由,以及推理循環追蹤。
本文探討了代理AI系統中的提示注入和工具濫用威脅,並介紹了專家推薦的五大防禦策略,包括最小權限原則、開源護欄、沙箱執行、人機協同檢查點以及監控審計。
本文教你如何使用Ollama在15分鐘內本地運行小型語言模型,涵蓋安裝、下載模型、對話、量化及故障診斷。
本文介紹了scikit-ollama庫,它通過將本地運行的Ollama模型與scikit-learn接口相結合,實現了零樣本文本分類,無需雲API。文章詳細説明了如何設置環境、加載數據集、實例化分類器以及執行擬合和預測,並強調了該方法的成本效益和數據隱私優勢。
比較三種開源LLM評估框架——RAGAS、DeepEval和Promptfoo,詳細説明它們的用途、適用場景以及理解LLM作為評判者的偏差的重要性。包括忠誠度檢查和CI門控評估的代碼演示。
本文詳細介紹了AI代理項目中導致失敗的架構和操作反模式,包括過早採用多代理系統、工具擴散、硬編碼邏輯、缺乏記憶設計、缺少可觀測性、無管控的寫權限、上下文漂移以及跳過評估。作者強調了從簡單開始、構建可觀測性、僅在能衡量回報時增加複雜性的重要性。
比較LangChain、LlamaIndex和原始API調用在LLM應用中的優缺點,提供選擇抽象層級的決策框架。
本文探討了在構建AI代理時如何決定將功能實現為工具還是子代理,以及如何避免過度工程化。工具執行代碼,子代理執行推理。文章提供了一個簡單的三問決策框架,並分析了引入子代理的實際成本。
當AI代理的工具數量增長時,準確率會下降。本文分析了“丟失在中間”效應和工具幻覺問題,並介紹了六種實用技術:門控、檢索、路由、規劃、回退邏輯與基準測試,幫助在規模擴展中保持工具選擇的高效與準確。
本文探討了上下文工程和記憶工程在Agentic AI系統中的區別與聯繫。上下文工程關注單次推理調用中的信息選擇、壓縮和放置,而記憶工程則涉及跨調用、跨會話的持久化信息管理。兩者在檢索邊界交匯,管理不善會導致檢索信息冗餘或上下文污染。
本文介紹了五種管理長時間運行AI代理應用上下文窗口的實用策略,包括滑動窗口、遞歸總結、結構化狀態管理、通過RAG的臨時上下文和動態上下文路由,並分析了每種策略的內在權衡。
Model Context Protocol(MCP)是Anthropic推出的開放標準,旨在統一AI應用與外部工具、數據源的通信方式。本文從三個遞進層次解析MCP:為何需要該協議、架構與請求流程、以及生產環境中的傳輸、安全與部署考量。
本文深入解析生產級AI智能體的七層技術棧,從基礎模型到部署基礎設施。涵蓋每層功能、代碼實現示例,以及不同場景(原型、初創、企業)的技術選型建議。
本文通過聚焦控制流的歸屬——是人類預先編寫代碼,還是模型在運行時推理——來區分代理工作流和自主代理。涵蓋了確定性工作流、編排工作流、反應式代理和自主多智能體系統,並提供了可運行的代碼示例。文章指出,真正的軸心是可預測性與自主性,而非是否使用LLM。在生產中,工作流(而非完全自主的代理)佔據主導地位,而混合架構是實際有效的模式。
本文解釋了為什麼大上下文窗口不等於智能體記憶,並介紹了檢索、壓縮和摘要技術如何在智能體的認知棧中協同工作,從而實現真正的記憶持久化。
本文介紹瞭如何結合大語言模型嵌入和HDBSCAN密度聚類算法,構建文本聚類管道,自動發現未標註文本數據中的主題。包括使用預訓練模型生成嵌入、UMAP降維、HDBSCAN聚類及可視化。
本文介紹瞭如何使用Playwright、browser-use和LangGraph在Python中構建能瀏覽和操作真實網站的AI代理。文章涵蓋了Playwright相較於Selenium的優勢(持久WebSocket連接、內置瀏覽器二進制、自動等待等)、環境搭建步驟、動態頁面抓取、多步驟表單填寫、反爬蟲處理、會話持久化以及Docker部署。通過實際代碼示例,讀者將學會構建一個能導航網站、填寫表單、提取結構化數據並通過LLM決策的瀏覽器代理。