本文にスキップ
AI News HubLIVE
公開記事 32収集記事 38信頼度 84更新頻度 120 分
稼働状態 正常ソース種別 公式全文利用権限 公式全文最終取り込み 2026-09-28ID llamaindex-blog状態 有効

Official agent and retrieval infrastructure blog; confirm reuse terms before full body display.

最新公開記事

翻訳待ち:Why VLMS Just Can

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Why forms need a purpose-built parser Representing a form’s structure Finding the boxes Attributing boxes to fields Parsing forms with LlamaParse Try it out A form is one of the most critical types of documents for a bu…

LlamaIndex Blogサイト内本文翻訳待ち:Why VLMS Just Can

翻訳待ち:Exploring Static Embedding Retrieval

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:What are static embeddings? Attempt #1: MaxSim over raw static tokens Attempt #2: teach the tokens some context It was working? Kinda? Attempt #3: a smarter teacher Attempt #4: skip the teacher, train on the actual metr…

LlamaIndex Blogサイト内本文翻訳待ち:Exploring Static Embedding Retrieval

翻訳待ち:Introducing ExtractBench: The Most Comprehensive Benchmark for Data Extraction from Enterprise Documents

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Why we built ExtractBench What ExtractBench evaluates How the ground truth was built Results Reproduce it yourself Enterprise agents increasingly act on critical business data, and much of that data lives in unstructure…

LlamaIndex Blogサイト内本文翻訳待ち:Introducing ExtractBench: The Most Comprehensive Benchmark for Data Extraction from Enterprise Documents

エージェンティックな文書抽出が精度と自動化を向上させる方法

従来のOCRはテキストを転写するだけですが、エージェンティックな文書抽出は文書処理を推論タスクとして扱い、視覚的接地、自己修正ループ、計画-行動-検証サイクルを用いて文書構造を理解し正確なデータを抽出します。本記事では、その原理、表や医療用紙などの複雑なレイアウトへの対応、ROIの利点、実装のベストプラクティスを説明します。

LlamaIndex Blogサイト内本文エージェンティックな文書抽出が精度と自動化を向上させる方法

非構造化データ抽出:ドキュメントをインサイトに変える

本記事では、非構造化データ抽出のコア技術、ワークフロー、実際の応用について解説します。NLP、NER、LLMを活用することで、企業は膨大なドキュメントから構造化情報を自動抽出し、メディアモニタリング、法務分析、医療研究などのユースケースを実現できます。また、マルチモーダル理解と検証ループを備えたLlamaParseのアプローチと、2026年に向けたベストプラクティスや将来動向も紹介します。

LlamaIndex Blogサイト内本文非構造化データ抽出:ドキュメントをインサイトに変える

OCR精度の解説:精度を向上させる方法

本記事では、OCR精度の測定方法(CER、WER、フィールドレベル精度)、精度に影響を与える要因(画像解像度、文書レイアウト、手書きのばらつきなど)、改善のための実践的ツールキット(前処理、合成データ学習、LLM後処理補正)、検証方法、そして2026年のOCRソリューション選択ガイドについて詳述します。精度はパイプラインの問題であり、最大の改善効果は認識前後の処理から得られます。

LlamaIndex Blogサイト内本文OCR精度の解説:精度を向上させる方法

AI文書分類:実践ガイド

AI文書分類は、文書の仕分けとタグ付けを自動化し、大規模な運用ボトルネックを解消します。この記事では、その仕組み、分類タイプ、活用事例、実装方法について説明します。

LlamaIndex Blogサイト内本文AI文書分類:実践ガイド

ディープエクストラクションがシングルパスパイプラインよりも優れている理由

ディープエクストラクションは、反復的なエージェント駆動の検証ループを使用して、複雑な文書でほぼ完璧なフィールド精度を達成します。一方、シングルパスパイプラインは高ボリュームで高リスクのワークフローで静かに失敗します。

LlamaIndex Blogサイト内本文ディープエクストラクションがシングルパスパイプラインよりも優れている理由

テンプレートOCRの真の代替手段:座標ではなくドキュメントを読む

テンプレートOCR(ゾーンOCR)は抽出をページ座標に依存するため、レイアウトが変わると静かにエラーを起こします。真の代替はエージェント型OCR(LlamaParseなど)で、レイアウト認識型コンピュータビジョンによりドキュメント構造を識別し、テンプレートなしで任意のフォーマットの最初の文書を処理できます。テンプレートライブラリのメンテナンス、オンボーディング遅延、ドリフトを排除し、フィールドレベルの信頼度スコアで人的レビューを絞り込みます。買掛金、送金通知、物流文書などのフォーマット変動が多いワークフローで特に有効です。

LlamaIndex Blogサイト内本文テンプレートOCRの真の代替手段:座標ではなくドキュメントを読む

住宅ローン銀行業務の文書自動化:一般的なワークフローのギャップ

住宅ローン文書の自動化は、各段階の内部ではなく、段階間の引き継ぎで失敗することが多い。データの来歴がなければ、各段階で数値を再検証し、コストと決済時間が増加する。LlamaParseのようなエージェンティック抽出は、ページレベルの引用と信頼性スコアを提供し、的を絞った人間によるレビューと追跡可能な監査証跡を可能にする。

LlamaIndex Blogサイト内本文住宅ローン銀行業務の文書自動化:一般的なワークフローのギャップ

解析、抽出、分類——それぞれが独自のMCPを持つように | ウィークリーニュースレター

LlamaIndexチームが倍増し、新機能をリリース:抽出は会話モード対応、高速ティアはMarkdown出力、Agentic Plusはテーブル処理改善、全プランで100ユーザー対応。AIニュースではGPT-5.6のベンチマーク、BunによるZigからRustへの書き換え、AppleのOpenAI提訴など。

LlamaIndex Blogサイト内本文解析、抽出、分類——それぞれが独自のMCPを持つように | ウィークリーニュースレター

解析、抽出、分類 — それぞれに独自のMCPを提供 | ウィークリーニュースレター

LlamaIndexは6月の忙しいシーズンに多数の製品アップデートをリリースしました。Retrieval Harness(エージェント向けファイルシステムツール)、LiteParseのMarkdownサポート、MCPエンドポイントの再構築、コスト最適化の改善、エンタープライズ向け使用タグとユーザーメタデータなどです。コミュニティではLiteParseとLanceDBのハンズオンビルド、n8nコミュニティノード、各種イベント講演が注目されました。AIニュースではAnthropicのFable 5延長、OpenAI DevDay 2026の応募受付開始などを取り上げています。

LlamaIndex Blogサイト内本文解析、抽出、分類 — それぞれに独自のMCPを提供 | ウィークリーニュースレター

LlamaParse検索ハーネス:AIエージェント向けファイルシステムプリミティブ

LlamaIndexは、LlamaParse Indexのアップデートとして、AIエージェントにファイルシステムレベルのドキュメントトラバーサルツール、ビジュアルレイアウト保存、マネージドインフラストラクチャ、パイプライン可観測性を提供する検索ハーネスを発表しました。

LlamaIndex Blogサイト内本文LlamaParse検索ハーネス:AIエージェント向けファイルシステムプリミティブ

n8n用LlamaParseプラットフォームノード:AIによる文書の解析、分類、抽出、検索

LlamaParseプラットフォームコミュニティノード(v5およびv6)は、n8nの公式検証済みコミュニティノードになりました。このノードは5つのLlamaCloudリソース(Parse、Classify、Split、Extract、Retrieve)を公開し、n8n AIエージェントのツールとして使用できます。v5ではSDKを廃止し直接HTTP呼び出しに変更、抽出機能をV2に移行、APIベースURLを設定可能にしました。v6では複数のノードを1つに統合し、インデックス操作を追加しました。記事では、検索ツールをエージェントツールとして使用する方法、分類→抽出→検証パイプライン、異なる解析モードでの出力評価の3つのワークフロー例を紹介しています。

LlamaIndex Blogサイト内本文n8n用LlamaParseプラットフォームノード:AIによる文書の解析、分類、抽出、検索

LiteParse が Markdown 出力に対応

LiteParse 2.1 は最速のオープンソース・モデルフリー PDF→Markdown パイプラインを提供し、3つのベンチマークでトップスコアを達成、多言語ランタイムをサポート。

LlamaIndex Blogサイト内本文LiteParse が Markdown 出力に対応

Claudeエージェント向けのより高速で低コストなPDF解析スキルの構築:LiteParseのケーススタディ

このブログ記事では、Claudeエージェント向けのLiteParse文書解析スキルを、評価、トレース分析、反復によってより安く、速く、高品質なものに改善した方法を詳述します。再解析、不要なOCR、過剰なgrep呼び出しなどのアンチパターンを特定・修正し、コストを37%削減し、すべての評価指標でスコアを向上させました。

LlamaIndex Blogサイト内本文Claudeエージェント向けのより高速で低コストなPDF解析スキルの構築:LiteParseのケーススタディ

LlamaIndex ニュースレター 6-10-26

今週は、CVPR 2026でのParseBench発表、ビジュアルドキュメントインテリジェンス向けParse-Flowのローンチ、Anthropic Fable 5ベンチマーク結果、LlamaParseの新しいGranular Bounding Box、そしてAI初のピックルボールトーナメントThe Agent Openをお届けします。

LlamaIndex Blogサイト内本文LlamaIndex ニュースレター 6-10-26

PDFを検索可能にする方法:手法と限界

この記事では、PDFの検索可能性の真の意味を探ります。Adobe Acrobatや無料オンラインツールなどの迅速なOCR手法は、簡素な文書には有効ですが、表、マルチカラムレイアウト、低品質スキャンでは失敗します。テキストレイヤーの精度が95%でもエラーが残り、検索が目的に到達できないことがあります。大規模な文書処理やAI統合には、LlamaParseのようなツールで構造化出力(Markdownなど)を生成し、読み取り順序と表構造を保持する必要があります。真の検索可能性は、テキストレイヤーの有無ではなく、精度と構造に依存します。

LlamaIndex Blogサイト内本文PDFを検索可能にする方法:手法と限界

契約メタデータの抽出:方法、課題、ワークフロー

組織は、言語、構造、フォーマットの多様性により、複雑な法的契約から構造化メタデータを抽出する際に大きな課題に直面しています。最新のシステムは、レイアウト認識解析、機械学習、セマンティック抽出、スキーママッピングを組み合わせて、非構造化法的合意を機械可読データに変換します。LlamaParseは、これらの機能を統合した構造化プラットフォームを提供し、本番ワークフローに対応します。

LlamaIndex Blogサイト内本文契約メタデータの抽出:方法、課題、ワークフロー

Parse-Flow:オープンソースのビジュアルドキュメントインテリジェンスワークフローデザイナー

Parse-Flow は、ビジュアルワークフローデザイナー、非同期ワーカー、ライブイベントダッシュボードを備えたオープンソースプロジェクトで、ドキュメント処理の4つの基本操作(解析、分類、分割、抽出)を統合します。バックエンドは llama-agents ワークフローエンジンに基づき、Redis と Postgres でジョブキューとイベント永続化を実現。本記事では、システムアーキテクチャ、ワークフロー定義、ステートマシンによる実行エンジン、設計上の利点について詳述します。

LlamaIndex Blogサイト内本文Parse-Flow:オープンソースのビジュアルドキュメントインテリジェンスワークフローデザイナー

grep vs. RAG:AIエージェントに適した検索戦略の選択

本記事では、AIエージェントにおけるgrep(語彙検索)とRAG(意味検索)を比較します。grepは小規模なプレーンテキストコーパスで高速かつ正確ですが、PDFなどの非構造化ドキュメントを扱えず、スケーラビリティに欠けます。RAGは解析、チャンク化、埋め込み、ベクトルインデックスによりスケーラブルな意味検索を実現し、語彙に依存しない検索を可能にします。推奨されるアプローチはレイヤー化です:非構造化ドキュメントを解析し、大規模には意味検索を使用し、適切なケースではgrepを保持します。

LlamaIndex Blogサイト内本文grep vs. RAG:AIエージェントに適した検索戦略の選択

LlamaIndex ニュースレター 5-19-26

今週のLlamaIndexニュースレターでは、AIエージェント向け初のOCRベンチマーク「ParseBench」、安全なドキュメント操作のためのSandboxed-Lit CLIエージェント、セルフホスト可能なドキュメント解析サーバー「LiteParse-Server」などの新オープンソースツールを紹介します。また、シンガポールとNYCでのコミュニティイベントの様子もお届けします。

LlamaIndex Blogサイト内本文LlamaIndex ニュースレター 5-19-26

LiteParseを使用した財務デューデリジェンスエージェントの構築方法

本記事では、SEC提出書類を取り込み、それらを検索し、正確な引用とともに質問に回答するAIエージェントのデモアプリを紹介します。重要な要素はLiteParseで、テキストとそのバウンディングボックス座標を抽出します。このプロジェクトではベクターデータベースの代わりに単純なキーワード検索を使用し、SEC EDGARと統合して直接書類を取得します。

LlamaIndex Blogサイト内本文LiteParseを使用した財務デューデリジェンスエージェントの構築方法

住宅ローン書類自動化:融資処理を変革する

住宅ローン書類の自動化は、インテリジェント文書処理を活用して、書類中心のワークフローを構造化された機械駆動のプロセスに変換し、効率を向上させエラーを削減します。この記事では、住宅ローン書類処理の複雑さ、自動化ワークフロー(取り込み、分類、抽出、検証、人間によるレビュー、システム統合)、課題、およびLlamaParseを使用した実装のベストプラクティスについて説明します。

LlamaIndex Blogサイト内本文住宅ローン書類自動化:融資処理を変革する

KYCにおけるOCR:標準テキスト抽出が不十分な理由

本記事では、KYC(顧客確認)ワークフローにおける標準OCR技術の限界を考察します。実際の身分証明書は摩耗、傾いた写真、ホログラム、非ラテン文字などに対応する必要があり、標準OCRでは不十分です。代理型OCR(LlamaParseなど)は、レイアウト認識、モデルオーケストレーション、自己修正ループにより90-95%以上のストレートスルー処理を実現し、銀行、保険、暗号資産取引所などの業界におけるコンプライアンス要件に対応します。

LlamaIndex Blogサイト内本文KYCにおけるOCR:標準テキスト抽出が不十分な理由

LlamaIndex ニュースレター:インテリジェントテーブル抽出とLiteSearch

今週のLlamaIndexニュースレターでは、インテリジェントテーブル抽出、ローカル文書検索システムLiteSearch、改善されたWord文書処理、Gemini Live APIとの統合、さらに法的発見やコミュニティプロジェクトのガイドを紹介します。

LlamaIndex Blogサイト内本文LlamaIndex ニュースレター:インテリジェントテーブル抽出とLiteSearch

LlamaIndex ニュースレター 2026-04-14

今週のニュースレターでは、AIエージェント向けに設計された初のOCRベンチマークであるParseBench、LiteParseの急成長、構造認識PDF QAパイプライン、VLM駆動のOCR運用インサイト、NYCフィンテックワークショップ、セキュアなドキュメントエージェントなどを紹介します。

LlamaIndex Blogサイト内本文LlamaIndex ニュースレター 2026-04-14

LlamaIndex ニュースレター 2026-04-21

今週のハイライトは、AIエージェント向け初のドキュメントOCRベンチマーク「ParseBench」のリリース、LiteParseのLlamaIndexエコシステムへの正式参加、Anthropic Opus 4.7の総合ベンチマーク、そして来週のNYCフィンテックウィークAIイベントです。

LlamaIndex Blogサイト内本文LlamaIndex ニュースレター 2026-04-21

LlamaParse MCP: AIエージェントのためのエージェント型OCRツール

LlamaParse Platform MCPがリファクタリングされ、ストレージ・検索からドキュメント処理へ焦点を移しました。本記事では、MCPが公開するツール、接続方法、設計上の決定事項(OAuth認証、ファイルアップロード解決策、可観測性、レート制限など)について説明します。

LlamaIndex Blogサイト内本文LlamaParse MCP: AIエージェントのためのエージェント型OCRツール

liteparse-server の紹介:AI ワークフローのためのセルフホスト型ドキュメント解析とOCR

liteparse-server は、LiteParse ドキュメント解析エンジンをラップしたセルフホスト型 HTTP API で、PDF、Office 文書、画像をサポートし、正確な空間レイアウトテキスト抽出と OCR を提供します。クラウド解析のレイテンシ、コスト、プライバシーの問題に対処し、RAG やビジョンモデルのワークフローに適しています。2つのデプロイモード:スリムサーバー(依存関係なし)とフルスタック(Redis キャッシュ、レート制限、OpenTelemetry トレーシング、Prometheus メトリクス)。

LlamaIndex Blogサイト内本文liteparse-server の紹介:AI ワークフローのためのセルフホスト型ドキュメント解析とOCR

全ソース