AI News HubLIVE
公開記事 53収集記事 55信頼度 76更新頻度 120 分
稼働状態 正常ソース種別 コミュニティ全文利用権限 サイト内リライト最終取り込み 2026-08-09ID machine-learning-mastery状態 有効

Machine learning education and applied AI source; summary-only unless authorization is obtained.

最新公開記事

翻訳待ち:Identifying Token Costs Hiding in Your Agentic Loop

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:But cutting your runtime token burn is just the first problem.

  • AI 生成が一時的に利用できないため、ソース内容とフォールバックメタデータを保存しました。
  • But cutting your runtime token burn is just the first problem.
サイト内本文

翻訳待ち:Designing AI Agents That Can Self-Correct

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:With the vocabulary and the failure modes in place, here's the build.

  • AI 生成が一時的に利用できないため、ソース内容とフォールバックメタデータを保存しました。
  • With the vocabulary and the failure modes in place, here's the build.
サイト内本文

翻訳待ち:7 Chunking Strategies That Decide Whether Your RAG Works

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:Day 100 in production isn't really about chunking strategies anymore.

  • AI 生成が一時的に利用できないため、ソース内容とフォールバックメタデータを保存しました。
  • Day 100 in production isn't really about chunking strategies anymore.
サイト内本文

翻訳待ち:Measuring Performance of Transformer Inference

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:This chapter is divided into eight parts; they are: • Metrics for LLM Inference • Measuring a Single Request • Warmup and Synchronization • Measuring GPU Work with CUDA Events • Measuring Memory Usage • Measuring Concurrent Requests • Multiple GPUs and Multiple Machines • Cost per Token The most common inference metrics are: • Latency: How long a request takes from start to finish.

  • AI 生成が一時的に利用できないため、ソース内容とフォールバックメタデータを保存しました。
  • This chapter is divided into eight parts; they are: • Metrics for LLM Inference • Measuring a Single Request • Warmup and Synchronization • Measuring GPU Work with CUDA Events • M…
サイト内本文

翻訳待ち:Static vs. Dynamic vs. Continuous Batching in LLM Inference

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:In this article, you will learn how static, dynamic, and continuous batching work in LLM inference, and why the differences between them matter at production...

  • AI 生成が一時的に利用できないため、ソース内容とフォールバックメタデータを保存しました。
  • In this article, you will learn how static, dynamic, and continuous batching work in LLM inference, and why the differences between them matter at production...
サイト内本文

翻訳待ち:Decoding Strategies and Output Control

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:This chapter is divided into nine parts; they are: • Reading Logits from a Model • Greedy Decoding • Temperature Sampling • Top-$k$ Sampling • Nucleus Sampling • Repetition Penalties • Beam Search • Stop Conditions • Structured Output Constraints The model returns a vector of logits for every position in the input sequence.

  • AI 生成が一時的に利用できないため、ソース内容とフォールバックメタデータを保存しました。
  • This chapter is divided into nine parts; they are: • Reading Logits from a Model • Greedy Decoding • Temperature Sampling • Top-$k$ Sampling • Nucleus Sampling • Repetition Penalt…
サイト内本文

翻訳待ち:Using a Transformer Model: From Training to Inference

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:This chapter is divided into four parts; they are: • Autoregressive Generation • Prefill and Decode • A Simple KV Cache • Memory Usage of the KV Cache A decoder-only transformer model predicts the next token from the tokens that came before it.

  • AI 生成が一時的に利用できないため、ソース内容とフォールバックメタデータを保存しました。
  • This chapter is divided into four parts; they are: • Autoregressive Generation • Prefill and Decode • A Simple KV Cache • Memory Usage of the KV Cache A decoder-only transformer m…
サイト内本文

翻訳待ち:The End-to-End Agentic AI Pipeline

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:In this article, you will learn the seven architectural components that separate a production-grade agentic AI system from a demo script, and how each one...

  • AI 生成が一時的に利用できないため、ソース内容とフォールバックメタデータを保存しました。
  • In this article, you will learn the seven architectural components that separate a production-grade agentic AI system from a demo script, and how each one...
サイト内本文

翻訳待ち:Ollama vs. LM Studio vs. llama.cpp: Which Local AI Runtime Should You Use in 2026?

AI サービスが一時的に利用できないため、復旧後に翻訳を補完します。ソース概要:In this article, you will learn how Ollama, LM Studio, and llama.cpp differ across the dimensions that matter most to practitioners, and how to choose...

  • AI 生成が一時的に利用できないため、ソース内容とフォールバックメタデータを保存しました。
  • In this article, you will learn how Ollama, LM Studio, and llama.cpp differ across the dimensions that matter most to practitioners, and how to choose...
サイト内本文

AIエージェントにおける永続メモリと状態のための5つのアーキテクチャパターン

本記事では、AIエージェントの永続的なメモリと状態を管理するための5つのアーキテクチャパターンを紹介します。コンテキスト作業バッファ、実行チェックポイント、セマンティックメモリ、エピソードイベントログ、マルチスコープ分離です。これらのパターンは、短期実行、フォールトトレランス、セッション間知識、履歴の振り返り、マルチテナントのデータプライバシーそれぞれに対処します。

  • 状態(現在のタスクのスナップショット)と記憶(境界を越える情報伝達手段)の区別が重要。
  • 5つのパターンは、短期実行、フォールトトレランス、セッション間知識、履歴振り返り、プライバシー分離をカバー。
サイト内本文

ステートフル vs ステートレスエージェント設計:スケーラブルなエージェントシステムのトレードオフ

この記事では、AIエージェントの状態管理の2つのパラダイム(ステートレスとステートフル)について、それぞれのスケーラビリティのトレードオフを解説し、Groq APIを使用したコード例で実装を示します。ステートレスエージェントは水平スケーリングが容易ですが、クライアントが会話履歴全体を送信する必要があり、ステートフルエージェントはデータベースでメモリを管理しますが、アーキテクチャが複雑になります。

  • ステートレスエージェントは各リクエストが独立しており、水平スケーリングが容易だが、マルチターン会話ではクライアントが履歴全体を再送する必要があり、トークン使用量が増加する。
  • ステートフルエージェントは自ら会話履歴を管理し、クライアントは新しいプロンプトとセッションIDのみを送信すればよい。複雑なワークフローに適するが、データベース層とキャッシュ戦略が必要。
サイト内本文

ループエンジニアリング入門

ループエンジニアリングは、AIエージェントが人間の常時介入なしに自律的に動作するための自己実行サイクルを設計する実践です。この概念は2026年6月に急速に広まり、ReAct(2022年)やReflexion(2023年)などの研究に基づき、プロンプトエンジニアリング、コンテキストエンジニアリング、ハーネスエンジニアリングに続く最新の層です。本記事では、定義、起源、構造、信頼性の高いループ構築の課題について解説します。

  • ループエンジニアリングは、AIエージェントの自律サイクルを設計し、人間による逐次的なプロンプトを不要にする。
  • 2026年6月にPeter SteinbergerとAddy Osmaniの投稿を契機に注目され、長年の研究が基盤にある。
サイト内本文

エージェンティックAIの現状

2026年半ばまでに、エージェンティックAIアーキテクチャは進化し、ネイティブ推論モデルがオーケストレーションループを置き換え、マルチエージェントスウォームとMCPによる標準化されたツールプロトコルが主流になりました。この記事では、ステートレスな専門エージェント、メモリーグラフ、セキュリティパターンの設計方法を解説します。

  • ネイティブ推論モデルにより、複雑な外部オーケストレーションフレームワークが不要になった。
  • ハンドオフツールで接続されたステートレスな専門エージェントによるマルチエージェントスウォーム。
サイト内本文

PythonでLangGraphを使ったエージェントワークフローの構築

この記事では、LangGraphを使用してPythonでエージェントワークフローを構築する方法を、単一モデル呼び出しからツールを使用し永続的な会話メモリを持つエージェントまで詳しく解説します。状態、ノード、エッジ、メッセージ履歴管理、モデル呼び出し、ツール登録とルーティング、ReAct推論ループをカバーしています。

  • LangGraphはエージェントをグラフとして表現し、状態、ノード、エッジで実行フローを可視化・検査可能にする。
  • MessagesStateはadd_messagesリデューサーを使用して会話履歴を自動的に管理する。
サイト内本文

エージェンティックAIセキュリティ:プロンプトインジェクションとツール悪用への防御

本記事では、エージェンティックAIシステムにおけるプロンプトインジェクションとツール悪用の脅威を解説し、最小権限の原則、オープンソースガードレール、サンドボックス実行、ヒューマン・イン・ザ・ループチェックポイント、監視・監査の5つの防御戦略を紹介します。

  • プロンプトインジェクションとツール悪用は、エージェントの目標ハイジャックや権限乱用を引き起こす重大な脅威です。
  • 従来のセキュリティ対策では、自律的に推論・行動するAIシステムを防御できません。
サイト内本文

Ollamaで15分でローカルAIモデルを実行する

Ollamaを使用して、15分以内に小型言語モデルをローカルマシン上で実行する方法を解説。インストール、モデルのダウンロード、完全オフラインでのチャットまでをカバー。量子化の基本と一般的なトラブルシューティングも紹介。

  • Ollamaを使えば、インストール、モデル取得、チャットの3ステップでローカルAIを始められる。
  • 4ビット量子化により、モデルサイズが60%以上削減(例:Llama 3.2 3Bは約2GB)。
サイト内本文

Scikit-Ollama:Scikit-LearnとローカルOllamaモデルの統合によるゼロショットテキスト分類

この記事では、scikit-ollamaライブラリを使用して、ローカルで実行するOllamaモデルをscikit-learnインターフェースと統合し、クラウドAPIを必要としないゼロショットテキスト分類を実現する方法を解説します。環境設定、データセットの読み込み、分類器のインスタンス化、フィット/予測パターンの適用、およびその仕組みについて詳しく説明します。

  • scikit-ollamaはscikit-llmをベースに、ローカルのOllamaモデルをscikit-learnワークフローに統合。
  • ローカルのLlama 3モデルを使用して映画レビューの感情分類をゼロショットで実行。
サイト内本文

LLM評価フレームワーク比較:モデルのパフォーマンスを実際に測定する方法

3つのオープンソースLLM評価フレームワーク(RAGAS、DeepEval、Promptfoo)を比較し、それぞれの目的、使用事例、LLM-as-a-judgeのバイアスを理解する重要性について詳しく説明します。忠実度チェックとCIゲート評価のコードウォークスルーも含みます。

  • RAGASはRAG固有のスコアリングに特化し、学術レベルの指標を提供。DeepEvalはpytestネイティブでCI/CD品質ゲート用。Promptfooはマルチモデル比較とレッドチーミングに優れる。
  • 一般的な指標には忠実度、コンテキスト精度/再現率、回答関連性、G-Evalがある。
サイト内本文

AIエージェントを構築する?避けるべきアンチパターン

本記事では、AIエージェントプロジェクトを失敗に導くアーキテクチャ上および運用上のアンチパターンについて解説します。早期のマルチエージェントシステム、ツールの乱立、ハードコードされたロジック、メモリ設計の欠如、可観測性の不足、無制限の書き込みアクセス、コンテキストのドリフト、評価のスキップなどが含まれます。単純に始め、可観測性を重視し、測定可能なリターンが得られる場合にのみ複雑性を追加する重要性を強調しています。

  • AIエージェントの失敗はモデルではなく、アーキテクチャと設計のミスに起因することが多い。
  • 早期のマルチエージェントアーキテクチャは調整のオーバーヘッドを生むため、まずは単一エージェントから始める。
サイト内本文

LLMオーケストレーションフレームワーク比較:LangChain vs. LlamaIndex vs. 生API呼び出し

LangChain、LlamaIndex、生API呼び出しのLLMアプリケーションにおける利点とトレードオフを比較し、適切な抽象化レベルの選択フレームワークを提供する。

  • LangChainは複雑なワークフローとエージェントのオーケストレーションに優れるが、オーバーヘッドとデバッグの複雑さが増す可能性がある。
  • LlamaIndexはRAG(検索拡張生成)に特化し、強力なデータ取り込みとインデックス機能を備える。
サイト内本文

ツール vs サブエージェント:オーバーエンジニアリングを避けて効果的なAIエージェントを構築する

この記事では、AIエージェントの機能をツールとして実装するかサブエージェントとして実装するかの判断方法と、過度な設計を避ける方法を解説します。ツールはコードを実行し、サブエージェントは推論を実行します。簡単な三つの質問による判断フレームワークと、サブエージェント導入の実際のコストを紹介します。

  • ツールはAPI呼び出しなどの決定論的な操作であり、サブエージェントは独立した推論ループである。
  • タスクが明確で多段階の推論を必要としない場合はツールを使用し、複雑な推論やコンテキスト分離、並列処理が必要な場合はサブエージェントを使用する。
サイト内本文

AIエージェントにおけるツール選択の完全ガイド

AIエージェントのツールカタログが拡大するにつれて精度が低下する問題を分析し、ゲーティング、検索ベースの選択、セマンティックルーティング、計画、フォールバックロジック、ベンチマークの6つの実践的手法を紹介します。大規模環境でも正確で効率的なツール選択を実現する方法を解説します。

  • ツール数が15~20を超えると、コンテキストの圧迫と「中間部喪失」効果によりエージェントの精度が顕著に低下する。
  • ゲーティングは会話的なターンを早期にフィルタリングし、レイテンシとコストを削減する。
サイト内本文

エージェンティックAIシステムにおけるコンテキストエンジニアリングとメモリエンジニアリング

本記事では、エージェンティックAIシステムにおけるコンテキストエンジニアリングとメモリエンジニアリングの違いと関係性を解説します。コンテキストエンジニアリングは単一の推論呼び出しにおける情報の選択、圧縮、配置を扱い、メモリエンジニアリングは呼び出しやセッションをまたいだ情報の永続化、検索、保守を扱います。両者は検索境界で交わり、その境界が適切に管理されないと、情報の陳腐化やコンテキスト汚染などの障害が発生します。

  • コンテキストエンジニアリングは、単一推論呼び出し内の情報選択・圧縮・配置によって推論品質を左右する。
  • メモリエンジニアリングは、書き込みポリシー、ストレージ、検索戦略、メンテナンスを包括し長期的信頼性を形作る。
サイト内本文

長時間実行エージェントのコンテキストウィンドウ管理:戦略とトレードオフ

本記事では、長時間実行されるAIエージェントアプリケーションにおけるコンテキストウィンドウ管理の5つの実用的な戦略と、それぞれのトレードオフについて説明します。

  • スライディングウィンドウはシンプルで高速だが、デジタル健忘症を引き起こす。
  • 再帰的要約は履歴を圧縮して長期記憶を維持するが、詳細を失う。
サイト内本文

モデルコンテキストプロトコル(MCP)を3段階の難易度で解説

Model Context Protocol(MCP)はAnthropicが導入したオープンスタンダードで、AIアプリケーションと外部ツール・データソース間の通信を標準化します。本記事では、MCPが必要な理由、アーキテクチャとリクエストフロー、そして本番環境でのトランスポート、セキュリティ、デプロイメントの考慮事項を3つのレベルで解説します。

  • MCPはM×NのカスタムアダプターをM+Nのプロトコル実装に削減し、統合の複雑さを軽減します。
  • アーキテクチャはホスト、クライアント、サーバーで構成され、クライアントがプロトコル機構を、サーバーが外部システムへの橋渡しを担当します。
サイト内本文

AIエージェント技術スタックの解説

本記事では、基本モデルからデプロイメントインフラに至るまで、プロダクション向けAIエージェントの7層の技術スタックを解説します。各層の機能、コード実装例、およびプロトタイプ、スタートアップ、エンタープライズ環境における技術選定のアドバイスを提供します。

  • AIエージェントは7層で構成:基本モデル、オーケストレーションフレームワーク、記憶システム、RAG、ツール、可観測性、デプロイメント。
  • 基本モデルは推論の中核であり、GPT-5.5、Claude Sonnet 4.6、Gemini 3.1 Pro、オープンウェイトモデルなどが選択肢。
サイト内本文

エージェンティックワークフローと自律エージェント:その違いは?

この記事では、制御フローの所有者に焦点を当てて、エージェンティックワークフローと自律エージェントを区別する方法を説明します。人間が事前にコードを書くのか、モデルが実行時に推論するのか。決定論的ワークフロー、オーケストレーションされたワークフロー、リアクティブエージェント(ReActループ)、自律型マルチエージェントシステムを、実行可能なコード例とともに網羅しています。真の軸は予測可能性と自律性であり、LLMが関与しているかどうかではありません。現在のプロダクションではワークフローが主流であり、ハイブリッドアーキテクチャが実際に有効なパターンです。

  • 核心的な違いは、次のステップを誰が決定するか:人間が事前に書いたコードか、モデルが実行時に推論するか。
  • 決定論的ワークフローは経路が固定;オーケストレーション型は事前定義された分岐あり;リアクティブエージェントは実行時に経路を決定;マルチエージェントシステムはサブエージェント間で委任する。
サイト内本文

コンテキストウィンドウは記憶ではない:AIエージェント開発者が理解すべきこと

この記事では、大きなコンテキストウィンドウがエージェントの記憶と同じではない理由と、検索、圧縮、要約の技術がエージェントの認知スタックでどのように連携するかを説明し、真の記憶の永続化を実現する方法を紹介します。

  • コンテキストウィンドウはステートレスの一時的な作業領域であり、永続的な記憶ではない。
  • 検索拡張生成(RAG)は関連データを取得するが、矛盾が生じる可能性があり、タイムスタンプによる優先順位付けが必要。
サイト内本文

LLM埋め込みとHDBSCANによる非構造化テキストのクラスタリング

大規模言語モデルの埋め込みとHDBSCANを組み合わせて、ラベルなしテキストデータから自動的にトピックを発見するテキストクラスタリングパイプラインの構築方法を紹介。埋め込み生成、UMAPによる次元削減、HDBSCANによるクラスタリングを解説。

  • sentence-transformersを使用してテキスト埋め込みを生成
  • UMAPで埋め込みの次元を削減
サイト内本文

Pythonでブラウザを使用するAIエージェントを構築する

この記事では、Playwright、browser-use、LangGraphを使用して、実際のWebサイトを閲覧・操作できるAIエージェントをPythonで構築する方法を解説します。トピックは、PlaywrightがSeleniumよりも優れている理由(30~50%高速、永続的WebSocket、内蔵自動待機、リアルなイベント)、環境設定手順、動的ページのスクレイピング、複数ステップのフォーム入力、アンチボット検出対策、セッション永続化、Dockerへのデプロイです。コード例を通じて、Webサイトをナビゲートし、フォームに記入し、構造化データを抽出し、LLMで意思決定を行う実用的なブラウザエージェントを作成します。

  • Playwrightは、永続的なWebSocket接続によりSeleniumより30~50%高速で、内蔵の自動待機と実際のマウス/キーボードイベントを備えている。
  • 環境設定はPython 3.10+、OpenAI APIキー、pipインストール(Playwrightブラウザバイナリを含む)のみで完了する。
サイト内本文

全ソース