跳到主要內容
AI News HubLIVE
公開文章 32採集文章 38可信度 84刷新頻率 120 分鐘
健康狀態 健康來源類型 官方原文權限 官方原文最近入庫 2026-09-28ID llamaindex-blog運行狀態 已啟用

Official agent and retrieval infrastructure blog; confirm reuse terms before full body display.

最新公開文章

待翻譯:Why VLMS Just Can

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Why forms need a purpose-built parser Representing a form’s structure Finding the boxes Attributing boxes to fields Parsing forms with LlamaParse Try it out A form is one of the most critical types of documents for a bu…

LlamaIndex Blog站內正文待翻譯:Why VLMS Just Can

待翻譯:Exploring Static Embedding Retrieval

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:What are static embeddings? Attempt #1: MaxSim over raw static tokens Attempt #2: teach the tokens some context It was working? Kinda? Attempt #3: a smarter teacher Attempt #4: skip the teacher, train on the actual metr…

LlamaIndex Blog站內正文待翻譯:Exploring Static Embedding Retrieval

待翻譯:Introducing ExtractBench: The Most Comprehensive Benchmark for Data Extraction from Enterprise Documents

AI 服務暫時不可用,以下為來源摘要,待恢復後補全翻譯:Why we built ExtractBench What ExtractBench evaluates How the ground truth was built Results Reproduce it yourself Enterprise agents increasingly act on critical business data, and much of that data lives in unstructure…

LlamaIndex Blog站內正文待翻譯:Introducing ExtractBench: The Most Comprehensive Benchmark for Data Extraction from Enterprise Documents

智能文檔提取如何提升準確度與自動化水平

傳統的OCR只能轉錄文本,而智能文檔提取(Agentic Document Extraction)通過推理式的文檔處理方式,結合視覺定位、自校驗循環等技術,能夠理解文檔結構、提取準確信息並減少人工審核需求。本文詳細介紹了智能文檔工作流的原理、應對複雜佈局(如表格、醫療表單)的方法,以及其在ROI和部署上的優勢。

LlamaIndex Blog站內正文智能文檔提取如何提升準確度與自動化水平

非結構化數據提取:將文檔轉化為洞察

本文探討了非結構化數據提取的核心技術、工作流程和實際應用。通過NLP、NER和LLM等技術,企業可以從海量文檔中自動提取結構化信息,應用於媒體監控、法律分析、醫療研究等領域。文章還介紹了LlamaParse的創新方法,包括多模態理解和多驗證循環,以及2026年的趨勢。

LlamaIndex Blog站內正文非結構化數據提取:將文檔轉化為洞察

OCR準確性解析:如何提升識別準確率

本文深入探討OCR準確性的測量方法(字符錯誤率、詞錯誤率、字段級準確性)、影響準確性的關鍵因素(圖像分辨率、文檔佈局、手寫變異性等)、實用改進工具包(預處理、合成數據訓練、LLM後處理校正)、驗證方法以及2026年OCR解決方案選擇指南。強調準確性是一個管道問題,最大的收益來自識別前後的處理。

LlamaIndex Blog站內正文OCR準確性解析:如何提升識別準確率

AI文檔分類:實用指南

AI文檔分類通過自動化文檔的排序和標記,解決了大規模文檔處理的操作瓶頸。本文介紹了其工作原理、分類類型、高價值用例,以及如何選擇和實施分類系統。

LlamaIndex Blog站內正文AI文檔分類:實用指南

為何深度提取優於單次流水線

深度提取採用迭代、智能體驅動的驗證循環,在複雜文檔上實現近乎完美的字段準確性,而單次流水線在高容量、高風險的流程中會悄然失敗。

LlamaIndex Blog站內正文為何深度提取優於單次流水線

模板OCR的真正替代方案:按內容讀取文檔而非座標

模板OCR(區域OCR)將提取與頁面座標綁定,佈局一旦變化就會靜默產生錯誤。真正的替代方案是智能體OCR(如LlamaParse),通過佈局感知計算機視覺識別文檔結構,無需模板即可處理任意格式的第一份文檔。這消除了模板庫的維護成本、上線延遲和漂移問題,並提供置信度分數用於定向人工審核。文章以應付賬款、匯款通知、物流單據等場景為例説明模板OCR的侷限和智能體OCR的優勢。

LlamaIndex Blog站內正文模板OCR的真正替代方案:按內容讀取文檔而非座標

抵押貸款文件自動化:常見的工作流程缺口

抵押貸款文件自動化通常在階段之間的交接處失敗,而非階段內部。沒有數據來源證明,每個階段都會重新驗證數字,增加成本和結案時間。代理提取(如LlamaParse)提供頁面級引用和置信度評分,實現有針對性的人工審查和可追溯的審計線索。

LlamaIndex Blog站內正文抵押貸款文件自動化:常見的工作流程缺口

解析、提取、分類——現在各自擁有自己的MCP | 每週通訊

LlamaIndex團隊規模翻倍,推出多項更新:提取支持對話模式、快速層級輸出Markdown、Agentic Plus改進表格處理、所有方案支持100用户。同時,AI新聞包括GPT-5.6性能分析、Bun用Rust重寫Zig代碼、蘋果起訴OpenAI等。

LlamaIndex Blog站內正文解析、提取、分類——現在各自擁有自己的MCP | 每週通訊

解析、提取、分類 — 現在每個都有獨立的 MCP | 每週通訊

LlamaIndex 發佈了多項產品更新,包括 Retrieval Harness(為 AI 代理提供文件系統工具)、LiteParse 的 Markdown 支持、MCP 端點重構、成本優化器改進、企業級使用標籤和用户元數據。社區方面,有 LiteParse 與 LanceDB 的結合實踐、n8n 節點集成以及多場活動演講。AI 新聞包括 Anthropic 延長 Fable 5 訪問權限、OpenAI DevDay 2026 申請開放等。

LlamaIndex Blog站內正文解析、提取、分類 — 現在每個都有獨立的 MCP | 每週通訊

LlamaParse檢索工具包:面向AI代理的文件系統原語

LlamaIndex發佈了LlamaParse索引的更新,新增檢索工具包,為AI代理提供文件系統級文檔遍歷工具,以及視覺佈局保留、託管基礎設施和管道可觀測性功能。

LlamaIndex Blog站內正文LlamaParse檢索工具包:面向AI代理的文件系統原語

n8n的LlamaParse平台節點:利用AI解析、分類、提取和檢索文檔

LlamaParse平台社區節點已發佈v5和v6版本,現為n8n官方驗證的社區節點。該節點整合了五個LlamaCloud資源(解析、分類、拆分、提取、檢索),支持作為AI Agent工具使用。v5重寫了基礎架構,v6將多個獨立節點整合為一個,並增加了索引管理功能。文章還提供了三種工作流示例:將檢索器作為Agent工具、構建分類-提取-驗證流水線、以及評估不同解析模式的輸出質量。

LlamaIndex Blog站內正文n8n的LlamaParse平台節點:利用AI解析、分類、提取和檢索文檔

LiteParse 新增 Markdown 輸出功能

LiteParse 2.1 推出最快的開源無模型 PDF 轉 Markdown 管道,在三大基準測試中均取得領先成績,並支持多語言運行環境。

LlamaIndex Blog站內正文LiteParse 新增 Markdown 輸出功能

為Claude智能體構建更快、更便宜的PDF解析技能:LiteParse案例研究

本文詳細介紹瞭如何通過迭代評估、分析追蹤和優化,為Claude智能體改進LiteParse文檔解析技能,使其更便宜、更快且質量更高。項目發現並修復了反模式,如重複解析、不必要的OCR和低效的grep調用,最終使成本降低37%,並在所有評判指標上獲得更高分數。

LlamaIndex Blog站內正文為Claude智能體構建更快、更便宜的PDF解析技能:LiteParse案例研究

LlamaIndex 新聞通訊 6-10-26

本期帶來 ParseBench 在 CVPR 2026 的展示、Parse-Flow 視覺文檔智能工作流、Anthropic Fable 5 基準測試結果、LlamaParse 新粒級邊界框,以及 AI 首個匹克球錦標賽 The Agent Open。

LlamaIndex Blog站內正文LlamaIndex 新聞通訊 6-10-26

如何使PDF可搜索:方法與侷限

本文探討了PDF可搜索性的真正含義。快速OCR方法(如Adobe Acrobat、免費在線工具)適用於簡單文檔,但在表格、多欄佈局和低質量掃描件上表現不佳。文本層即使有95%準確率仍會遺留錯誤,導致關鍵信息無法被檢索。對於大規模文檔處理或AI集成,需要像LlamaParse這樣提供結構化輸出(如Markdown)和高準確率的工具,以保留閲讀順序和表格結構。真正的可搜索性取決於準確性和結構,而非僅僅文本層的存在。

LlamaIndex Blog站內正文如何使PDF可搜索:方法與侷限

提取合同元數據:方法、挑戰與工作流程

組織在從複雜的法律合同中提取結構化元數據時面臨重大挑戰,因為語言、結構和格式的多樣性。現代系統結合了佈局感知解析、機器學習、語義提取和模式映射,將非結構化的法律協議轉化為機器可讀數據。LlamaParse 提供了一個集成的平台,將這些能力整合到生產工作流中。

LlamaIndex Blog站內正文提取合同元數據:方法、挑戰與工作流程

Parse-Flow:開源可視化文檔智能工作流設計器

Parse-Flow 是一個開源項目,通過可視化工作流設計器、異步工作器和實時事件儀表板,將文檔處理的四個基本操作——解析、分類、拆分和提取——整合在一起。後端基於 llama-agents 工作流引擎,使用 Redis 和 Postgres 實現任務隊列與事件持久化。本文詳細介紹了系統架構、工作流定義、基於狀態機的執行引擎以及設計優勢。

LlamaIndex Blog站內正文Parse-Flow:開源可視化文檔智能工作流設計器

grep vs. RAG:為AI智能體選擇正確的搜索策略

本文對比了grep(詞法搜索)與RAG(語義搜索)在AI智能體中的應用場景。grep在小規模純文本語料庫中快速精準,但無法處理PDF等非結構化文檔,且擴展性差。RAG通過解析、分塊、嵌入和向量索引實現規模化語義搜索,支持自然語言查詢,但需要額外基礎設施。作者建議採用分層方法:先用工具解析非結構化文檔,再用語義搜索處理大規模語料,同時在適用場景保留grep。

LlamaIndex Blog站內正文grep vs. RAG:為AI智能體選擇正確的搜索策略

LlamaIndex 新聞通訊 5-19-26

本期LlamaIndex新聞通訊介紹了ParseBench——首個為AI代理構建的OCR基準測試,以及新的開源工具:用於安全文檔交互的Sandboxed-Lit CLI代理和用於私有部署的LiteParse-Server。此外,還回顧了新加坡和紐約的社區活動。

LlamaIndex Blog站內正文LlamaIndex 新聞通訊 5-19-26

如何使用LiteParse構建財務盡職調查代理

本文介紹了一個利用LiteParse構建的AI代理演示應用,該代理能夠處理SEC文件、跨文件搜索並回答帶有精確引用的問題。文章詳細講解了項目架構,包括PDF解析、文檔存儲、工具定義、聊天端點和引用系統,並説明了如何集成SEC EDGAR獲取文件。整個項目約600行庫代碼,無需向量數據庫或外部基礎設施。

LlamaIndex Blog站內正文如何使用LiteParse構建財務盡職調查代理

抵押貸款文檔自動化:重塑貸款處理流程

抵押貸款文檔自動化利用智能文檔處理技術,將文檔密集型工作流轉化為結構化、機器驅動的流程,從而提高效率、減少錯誤。本文分析了抵押貸款處理的複雜性、自動化工作流(文檔攝取、分類、數據提取、驗證、人工審核及系統集成)、面臨的挑戰,並介紹了使用LlamaParse實施自動化的最佳實踐。

LlamaIndex Blog站內正文抵押貸款文檔自動化:重塑貸款處理流程

KYC中的OCR:為什麼標準文本提取不夠用

本文探討了標準OCR技術在KYC(瞭解你的客户)工作流程中的不足,包括對複雜證件、安全特徵和多語言支持的侷限性。介紹了代理型OCR(如LlamaParse)如何通過佈局感知分割、模型編排和自糾錯循環來提高準確率,並分析了銀行業、保險業和加密貨幣交易所中的應用與合規需求。

LlamaIndex Blog站內正文KYC中的OCR:為什麼標準文本提取不夠用

LlamaIndex 新聞通訊:智能表格提取與 LiteSearch

本週的 LlamaIndex 新聞通訊重點介紹了智能表格提取、用於本地文檔檢索的 LiteSearch、改進的 Word 文檔處理,以及與 Gemini Live API 的集成,同時提供了法律發現和社區項目的指南。

LlamaIndex Blog站內正文LlamaIndex 新聞通訊:智能表格提取與 LiteSearch

LlamaIndex 新聞簡報 2026-04-14

本期簡報介紹了 ParseBench——首個專為AI代理設計的OCR基準測試,以及LiteParse的快速增長、結構感知PDF QA管道、VLM驅動的OCR生產洞察、紐約金融科技研討會和安全文檔代理等重要更新。

LlamaIndex Blog站內正文LlamaIndex 新聞簡報 2026-04-14

LlamaIndex 新聞通訊 2026-04-21

本期重點包括首個AI代理文檔OCR基準測試ParseBench的發佈、LiteParse正式加入LlamaIndex生態系統、Anthropic Opus 4.7的全面基準測試以及即將舉行的紐約金融科技周AI活動。

LlamaIndex Blog站內正文LlamaIndex 新聞通訊 2026-04-21

LlamaParse MCP:為AI代理提供智能OCR工具

LlamaParse平台MCP已重構,從存儲檢索轉向文檔處理。本文介紹了MCP暴露的工具、連接方式以及設計決策,包括OAuth認證、文件上傳解決方案(URL上傳和令牌端點)、可觀測性和速率限制等。

LlamaIndex Blog站內正文LlamaParse MCP:為AI代理提供智能OCR工具

liteparse-server 介紹:用於 AI 工作流的自託管文檔解析與 OCR

liteparse-server 是一個自託管的 HTTP API,封裝了 LiteParse 文檔解析引擎,支持 PDF、Office 文檔和圖像,提供精確的空間佈局文本提取和 OCR 功能。它解決了雲端解析的延遲、成本和隱私問題,適用於 RAG、視覺模型等工作流。支持兩種部署模式:輕量級服務器(無依賴)和完整堆棧(帶 Redis 緩存、限流、OpenTelemetry 追蹤、Prometheus 指標)。

LlamaIndex Blog站內正文liteparse-server 介紹:用於 AI 工作流的自託管文檔解析與 OCR

全部來源