待翻譯:Identifying Token Costs Hiding in Your Agentic Loop
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:But cutting your runtime token burn is just the first problem.
- AI 服務暫時不可用,系統已先保留來源內容與降級後設資料。
- But cutting your runtime token burn is just the first problem.
來源詳情
AI News Hub 持續追蹤 Machine Learning Mastery 的 AI 更新,並公開來源狀態、授權邊界、抓取方式和已發布文章。
Machine learning education and applied AI source; summary-only unless authorization is obtained.
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:But cutting your runtime token burn is just the first problem.
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:With the vocabulary and the failure modes in place, here's the build.
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Day 100 in production isn't really about chunking strategies anymore.
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:This chapter is divided into eight parts; they are: • Metrics for LLM Inference • Measuring a Single Request • Warmup and Synchronization • Measuring GPU Work with CUDA Events • Measuring Memory Usage • Measuring Concurrent Requests • Multiple GPUs and Multiple Machines • Cost per Token The most common inference metrics are: • Latency: How long a request takes from start to finish.
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:In this article, you will learn how static, dynamic, and continuous batching work in LLM inference, and why the differences between them matter at production...
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:This chapter is divided into nine parts; they are: • Reading Logits from a Model • Greedy Decoding • Temperature Sampling • Top-$k$ Sampling • Nucleus Sampling • Repetition Penalties • Beam Search • Stop Conditions • Structured Output Constraints The model returns a vector of logits for every position in the input sequence.
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:This chapter is divided into four parts; they are: • Autoregressive Generation • Prefill and Decode • A Simple KV Cache • Memory Usage of the KV Cache A decoder-only transformer model predicts the next token from the tokens that came before it.
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:In this article, you will learn the seven architectural components that separate a production-grade agentic AI system from a demo script, and how each one...
AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:In this article, you will learn how Ollama, LM Studio, and llama.cpp differ across the dimensions that matter most to practitioners, and how to choose...
本文介紹了AI智慧體中處理持久化記憶體和狀態的五種架構模式,包括:上下文工作緩衝區、執行檢查點、語義記憶、事件日誌和多範圍隔離。這些模式幫助智慧體在長時間執行中保持狀態一致性、故障恢復能力、跨會話知識持久化、歷史反思學習以及多租戶資料隱私。
本文探討了AI代理中狀態管理的兩種正規化——無狀態和有狀態設計,分析了各自的擴充套件性權衡,並透過Groq API的程式碼示例說明了實現方式。無狀態代理易於水平擴充套件但需客戶端傳遞完整對話歷史,有狀態代理透過資料庫管理記憶體但增加架構複雜性。
迴圈工程是設計自主AI代理迴圈的實踐,使其無需持續人工干預即可可靠執行。該概念在2026年6月迅速崛起,建立在ReAct(2022)和Reflexion(2023)等研究基礎之上,是提示工程、上下文工程和框架工程之後的又一發展。本文探討了迴圈工程的定義、起源、解剖結構以及構建可靠迴圈的挑戰。
到2026年中,自主AI架構已演進,原生推理模型取代了編排迴圈,多智慧體蜂群和透過MCP標準化的工具協議成為主流。本文涵蓋如何設計無狀態專業智慧體、記憶圖和安全模式。
本文詳細介紹瞭如何使用LangGraph在Python中構建完整的智慧體工作流,從單次模型呼叫到具有持久對話記憶的工具使用智慧體。涵蓋了狀態、節點、邊的定義,訊息歷史管理,模型呼叫,工具註冊與路由,以及推理迴圈追蹤。
本文探討了代理AI系統中的提示注入和工具濫用威脅,並介紹了專家推薦的五大防禦策略,包括最小許可權原則、開源護欄、沙箱執行、人機協同檢查點以及監控審計。
本文教你如何使用Ollama在15分鐘內本地執行小型語言模型,涵蓋安裝、下載模型、對話、量化及故障診斷。
本文介紹了scikit-ollama庫,它透過將本地執行的Ollama模型與scikit-learn介面相結合,實現了零樣本文本分類,無需雲API。文章詳細說明了如何設定環境、載入資料集、例項化分類器以及執行擬合和預測,並強調了該方法的成本效益和資料隱私優勢。
比較三種開源LLM評估框架——RAGAS、DeepEval和Promptfoo,詳細說明它們的用途、適用場景以及理解LLM作為評判者的偏差的重要性。包括忠誠度檢查和CI門控評估的程式碼演示。
本文詳細介紹了AI代理專案中導致失敗的架構和操作反模式,包括過早採用多代理系統、工具擴散、硬編碼邏輯、缺乏記憶設計、缺少可觀測性、無管控的寫許可權、上下文漂移以及跳過評估。作者強調了從簡單開始、構建可觀測性、僅在能衡量回報時增加複雜性的重要性。
比較LangChain、LlamaIndex和原始API呼叫在LLM應用中的優缺點,提供選擇抽象層級的決策框架。
本文探討了在構建AI代理時如何決定將功能實現為工具還是子代理,以及如何避免過度工程化。工具執行程式碼,子代理執行推理。文章提供了一個簡單的三問決策框架,並分析了引入子代理的實際成本。
當AI代理的工具數量增長時,準確率會下降。本文分析了“丟失在中間”效應和工具幻覺問題,並介紹了六種實用技術:門控、檢索、路由、規劃、回退邏輯與基準測試,幫助在規模擴充套件中保持工具選擇的高效與準確。
本文探討了上下文工程和記憶工程在Agentic AI系統中的區別與聯絡。上下文工程關注單次推理呼叫中的資訊選擇、壓縮和放置,而記憶工程則涉及跨呼叫、跨會話的持久化資訊管理。兩者在檢索邊界交匯,管理不善會導致檢索資訊冗餘或上下文汙染。
本文介紹了五種管理長時間執行AI代理應用上下文視窗的實用策略,包括滑動視窗、遞迴總結、結構化狀態管理、透過RAG的臨時上下文和動態上下文路由,並分析了每種策略的內在權衡。
Model Context Protocol(MCP)是Anthropic推出的開放標準,旨在統一AI應用與外部工具、資料來源的通訊方式。本文從三個遞進層次解析MCP:為何需要該協議、架構與請求流程、以及生產環境中的傳輸、安全與部署考量。
本文深入解析生產級AI智慧體的七層技術棧,從基礎模型到部署基礎設施。涵蓋每層功能、程式碼實現示例,以及不同場景(原型、初創、企業)的技術選型建議。
本文透過聚焦控制流的歸屬——是人類預先編寫程式碼,還是模型在執行時推理——來區分代理工作流和自主代理。涵蓋了確定性工作流、編排工作流、反應式代理和自主多智慧體系統,並提供了可執行的程式碼示例。文章指出,真正的軸心是可預測性與自主性,而非是否使用LLM。在生產中,工作流(而非完全自主的代理)佔據主導地位,而混合架構是實際有效的模式。
本文解釋了為什麼大上下文視窗不等於智慧體記憶,並介紹了檢索、壓縮和摘要技術如何在智慧體的認知棧中協同工作,從而實現真正的記憶持久化。
本文介紹瞭如何結合大語言模型嵌入和HDBSCAN密度聚類演算法,構建文本聚類管道,自動發現未標註文本資料中的主題。包括使用預訓練模型生成嵌入、UMAP降維、HDBSCAN聚類及視覺化。
本文介紹瞭如何使用Playwright、browser-use和LangGraph在Python中構建能瀏覽和操作真實網站的AI代理。文章涵蓋了Playwright相較於Selenium的優勢(持久WebSocket連線、內建瀏覽器二進位制、自動等待等)、環境搭建步驟、動態頁面抓取、多步驟表單填寫、反爬蟲處理、會話持久化以及Docker部署。透過實際程式碼示例,讀者將學會構建一個能導航網站、填寫表單、提取結構化資料並透過LLM決策的瀏覽器代理。