AIエージェントの評価:StrandsとAgentCoreを用いたプロダクションブループリント
MotorwayとAWSは、エンドツーエンドの評価パイプラインを構築し、誤った結果をクエリ8回に1回から50回に1回に削減し、問題検出時間を数時間から数分に短縮しました。このパイプラインは、Strands Agents SDKとAmazon Bedrock AgentCore(AIエージェントを大規模に展開・運用するためのフルマネージドサービス)を組み合わせています。この記事では、独自のエージェント向けにこのパイプラインを構築する方法を学びます。
- MotorwayとAWSは、自然言語クエリで手動フィルタリングを置き換えるAI駆動のディーラー在庫検索エージェントを構築。
- 2フェーズの評価戦略:ビルド時テスト(strands-agents-evals)と本番監視(Amazon Bedrock AgentCore Evaluations)。
Amazon Bedrock AgentCore最適化によるサイレントエージェント障害の検出
Amazon Bedrock AgentCore最適化は、本番AIエージェントにおけるサイレントな動作障害(すべてのヘルスチェックに合格するが誤った結果を出力するもの)を表面化します。インサイトがセッション全体で障害パターンを発見、説明、ランク付けし、影響の大きい問題から修正できるようにする方法を学びましょう。
- サイレント障害はエラー信号を生成せずに誤った結果を引き起こします(例:未実行の注文、在庫ステータスの誤り)。
- AgentCoreはセッショントレースを分析し、幻覚、誤ったアクションなど11種類の動作障害タイプを検出します。
Amazon Bedrock マネージド知識ベースのエージェンティック検索
従来の検索は、複数部分からなる質問、比較質問、探索的質問には不十分です。エージェンティック検索は、基盤モデルを使用してクエリを分解し、意図ごとに検索し、十分性を評価する計画ループによってこれを解決します。この記事では、その必要性、AgenticRetrieveStream APIの動作、および標準のRetrieve APIと比較した選択基準を説明します。
- 単発検索は複数意図のクエリでは効果的に機能しません。
- エージェンティック検索は基盤モデルを使用して計画し、意図ごとに検索し、反復します。
エージェントの重要なアクションに対するバリューポイズニングベンチマーク
この記事では、AIモデルが信頼できない文書から偽造された値を実行するかどうかを評価するベンチマークを紹介しています。10の重要なワークフローにおいて、テストしたすべてのモデル(4つのプロバイダから)がさまざまな脆弱性を示し、防御策ActionRailはすべての汚染操作を阻止し、誤検出もゼロでした。
- AIエージェントが実際のアクションで偽造値を実行するリスクに対する新しいベンチマーク手法を提案。
- 4つのプロバイダから8つのモデルをテストし、すべてのモデルに脆弱性があり、成功率は1.7%から63.3%の範囲。
Linusが正しく、AIが間違っている理由
Linus TorvaldsがLinuxカーネル開発におけるAIの立場についてメーリングリストで述べた内容を分析。LinusはAIをツールと見なし、技術的メリットを重視する姿勢を示す。著者はこの立場を合理的と評価する一方、AIハイプマシンによるLinusの言葉の悪用と文脈無視を批判する。修辞技法、テキスト分析における「解釈」と「強解」、権威ある発言の武器化について深く掘り下げる。
- Linus TorvaldsはLinuxは反AIプロジェクトではなく、反対派はフォークするか去るよう明言。
- 著者はLinusの立場を妥当としつつ、AI推進派がその言葉を批判者抑圧に利用することを警告。