ディープエージェントのベンチマーク方法
ディープエージェントの評価は困難です。Harborを使用したエンドツーエンド評価を再構築し、コーディング、会話、検索の3つのベンチマークを導入した方法を共有します。
- Harborを使ったエンドツーエンド評価:環境、指示、評価スクリプト。
- 3つのベンチマーク:Harbor-Index(自律作業)、τ³-bench(会話)、ContextBench(検索)。
デイリー
2026-07-24 の厳選ニュース 10 件をトピック別に整理します。その他はアーカイブに折りたたみます。
ディープエージェントの評価は困難です。Harborを使用したエンドツーエンド評価を再構築し、コーディング、会話、検索の3つのベンチマークを導入した方法を共有します。
Cursorがモデルルーター「Cursor Router」を発表。各コーディング要求に最適なAIモデルを自動選択し、コストを削減し品質を維持。RampとMetaも類似ツールを公開。Cursor自身も強力なモデルを開発し、AIスタックを制御し始めている。
Setoku はオープンソースのセルフホスト型 MCP 知識サーバーで、AIエージェントに会社データへの読み取り専用アクセス、メトリクス定義や落とし穴の記憶、ダッシュボードの構築と共有を提供します。安価な VPS で動作し、モデル推論コストは不要。知識更新には人間の承認が必要で、セキュリティを重視しています。
MotorwayとAWSは、エンドツーエンドの評価パイプラインを構築し、誤った結果をクエリ8回に1回から50回に1回に削減し、問題検出時間を数時間から数分に短縮しました。このパイプラインは、Strands Agents SDKとAmazon Bedrock AgentCore(AIエージェントを大規模に展開・運用するためのフルマネージドサービス)を組み合わせています。この記事では、独自のエージェント向けにこのパイプラインを構築する方法を学びます。
LLMトレースをクラスタリングするために、LLMによる要約ではなく、コントラクトブロックハッシュと決定論的特徴を使用する手法。モデルコストがほぼゼロで、ほぼ完璧な精度と再現率を達成。
Jefferiesは、Strands Agents、Amazon Bedrock、MCPツールを使用してエージェント型AIトレードアシスタントを構築し、トレーダーが自然言語でデータをクエリできるようにし、ITへの依存を減らしてインサイトを得る時間を短縮しました。
シカゴ大学ロースクールは、AI時代に法学教育を適応させるための戦略声明を発表しました。これには、AIに影響されない教育学の開発、人間の重要なスキルの向上、責任あるAIの使用の指導が含まれます。同校は2026-2027学年度に、1年生のコア科目での電子機器禁止、インターネットなしの試験、法学研究とライティングへのAI統合などの新しいポリシーを試験的に導入する予定です。
AMDは2026年に向けたAIロードマップとビジョンを発表し、ハードウェアの進化と開発者エコシステムに焦点を当てています。
OpenAIは木曜日、米国でChatGPT Healthを全ユーザーに展開し、医療記録や健康追跡データをチャットボットに接続できるようにする。同社幹部はモデルの推論能力が臨床医レベルを上回ると主張したが、後にその主張を緩めた。一方で、ChatGPTの「極めて危険な医療アドバイス」を巡り、牧師が提訴した。
CentricaのCEOクリス・オシェイ氏が同社の計画を擁護。小売利益の増加を報告し、より高い利益率に注力している。
この記事では、Highchartsカスタムビジュアライゼーションを使用してQuickSightでマルチリージョンのキャリアパフォーマンスダッシュボードを構築し、ネイティブチャートの制限を克服する方法を紹介します。QuickSightのフェデレーションデータセット機能を通じて、AWSリージョン間でデータ主権を維持しながら、統一された可視化を作成する方法を学びます。このソリューションには、本番環境対応のチャート設定が含まれており、セキュリティ、コンプライアンス、スケーラビリティの要件に対応します。
Amazon Bedrock AgentCore最適化は、本番AIエージェントにおけるサイレントな動作障害(すべてのヘルスチェックに合格するが誤った結果を出力するもの)を表面化します。インサイトがセッション全体で障害パターンを発見、説明、ランク付けし、影響の大きい問題から修正できるようにする方法を学びましょう。
従来の検索は、複数部分からなる質問、比較質問、探索的質問には不十分です。エージェンティック検索は、基盤モデルを使用してクエリを分解し、意図ごとに検索し、十分性を評価する計画ループによってこれを解決します。この記事では、その必要性、AgenticRetrieveStream APIの動作、および標準のRetrieve APIと比較した選択基準を説明します。
この記事では、AIモデルが信頼できない文書から偽造された値を実行するかどうかを評価するベンチマークを紹介しています。10の重要なワークフローにおいて、テストしたすべてのモデル(4つのプロバイダから)がさまざまな脆弱性を示し、防御策ActionRailはすべての汚染操作を阻止し、誤検出もゼロでした。
Linus TorvaldsがLinuxカーネル開発におけるAIの立場についてメーリングリストで述べた内容を分析。LinusはAIをツールと見なし、技術的メリットを重視する姿勢を示す。著者はこの立場を合理的と評価する一方、AIハイプマシンによるLinusの言葉の悪用と文脈無視を批判する。修辞技法、テキスト分析における「解釈」と「強解」、権威ある発言の武器化について深く掘り下げる。