EHRBenchは、電子健康記録(EHR)を活用し、EHR-LLM-知識ベースのパイプラインを通じて診断、治療、予後の3つのタスクをカバーする約100万のQA項目を自動生成する信頼性の高いベンチマークです。30以上のLLMを評価し、一貫した性能傾向と臨床的信頼性へのギャップを明らかにしました。本研究はKDD 2026に採択されています。
AI ニュース速報
リアルタイム監視
最新ニュース
信頼できる情報源、出典、権限、サイト内閲覧を保ちながら、AI の変化を読める情報に圧縮します。
最新ニュース
LLMエージェントは、プロンプト、スキル、記憶、ツールなどの外部ハーネスを更新することで適応するが、モデルの基本タスク解決能力がハーネスの自己進化能力を予測できるかは不明である。研究では、ハーネス更新能力は基本能力に関係なく平坦である一方、ハーネス利益能力は非単調であり、中堅モデルが最も恩恵を受け、弱モデルと強モデルは恩恵が少ないことが示された。推奨事項として、進化器よりもタスク解決エージェントへの投資、およびハーネス呼び出しと長期的指示追従のトレーニングに焦点を当てることが挙げられる。
arXivに投稿された研究論文では、品質多様性アルゴリズムMAP-Elitesを用いてファーストパーソン・シューティング(FPS)ゲームのマップを手続き的に生成する方法を探求している。著者らは2つの新しいマップ表現(Point-LineとSpatial-Layout)を導入し、トポロジカル特性と創発特性のための一連の指標を定義した。スライディング境界付きMAP-Elites(MESB)を使用してマップを進化させた結果、新しい表現は従来の方法よりも多様性と品質において優れたマップを生成できることが示された。
本論文では、ファクター化タスク(FTS)をSATにエンコードする方法を調査し、複数のエンコード戦略を提案し、タスク変換と並列性がSATベースのプランナーのパフォーマンスに与える影響を分析する。
PhyDrawGenは、テキストから物理法則に従った図を生成するニューロシンボリックパイプラインです。大規模言語モデルでシーングラフを抽出し、決定論的ソルバーで平面直線グラフに変換し、ファインチューニングされたQwen-VLモデルで検証します。1449の物理問題ベンチマークで、GPT-5-imageやGeminiモデルを上回る性能を示しました。
PayPalとPalantirの共同創業者ピーター・ティール氏は、AIは数学やSTEM分野に対して、クリエイティブやコミュニケーション職よりも大きな脅威となると主張。LinkedInのデータによると、ストーリーテリングなどのソフトスキルの需要が高まっており、一部の企業は100万ドル以上の報酬を提示。一方、一部のSTEM専攻では失業率が高いが、全てではない。ティール氏は、AIが医学などの分野で数学の壁を不要にする可能性があると示唆。
Mistral Vibeは、長時間実行される多段階の作業やプログラミングタスクに特化したAIエージェントです。Product Huntでの議論を紹介します。
Instagramで、多要素認証(MFA)が設定されていないアカウントに対し、Meta AIを使ってパスワードをリセットできる脆弱性が発見され、修正されました。AI機能のセキュリティリスクが浮き彫りに。
Smart Rename は、ローカルAIモデル(llava)を使用してフォルダを監視し、画像ファイルに自動的に説明的な名前を付けるオープンソースツールです。完全にオフラインで動作し、プライバシーを保護し、システムトレイアイコンから制御できます。
人気YouTuberのPewDiePieが、OpenCode上に構築されたAIワークスペースを公開。クリエイター向けにAIツールを統合し、作業効率を向上させる。
MiniMaxはマルチモーダル基盤モデルMiniMax M3を発表し、OpenRouterでサービスを開始しました。テキスト、画像、動画の入力に対応し、100万トークンのコンテキストウィンドウを備え、長期的なエージェント業務、コーディング、ツール使用に最適です。同社独自のスパースアテンション技術により、長いコンテキストでの計算コストを大幅に削減します。
TestFlightを使用したベータ版アプリのテストガイド。iOS、iPadOS、macOS、tvOS、visionOS、watchOSアプリのインストール手順、システム要件、アップデート管理、さまざまなビルドのテスト方法を説明します。
英内務省がドーバー海峡経由の移民にAI顔年齢推定技術を試験導入する計画に、人権団体が強い批判。精度の問題、人口統計学的偏り、法的懸念が指摘されている。平均絶対誤差1.88年だが、非白人や女性、劣悪な条件下で誤差が拡大する。法律専門家は、既存のAIツールが申請者の知る権利を侵害する可能性があると主張。
Moxie Docs は GitHub リポジトリの生きたドキュメントを作成し、MCP を介して AI エージェントにコンテキストを提供し、検索可能なワークスペースと PR チェックでドキュメントを最新に保ちます。
AnthropicがSECにS-1を秘密提出しIPOプロセスを開始、Claude Opus 4.8をリリース(コード信頼性4倍向上)。NVIDIAはGTC台北でCosmos 3のオープンソース化、Vera Rubinの生産開始、RTX SparkによるノートPC向け1ペタフロップスAI計算を発表。GoogleはGemini 2.0 Flashを退役。カリフォルニア州は子供向け玩具のAIチャットボット禁止法案を可決、イリノイ州のデータセンター規制法案は停滞。
Anthropicが650億ドルを調達し、評価額9650億ドルでClaude Opus 4.8をリリース。NVIDIAはGTC TaipeiでCosmos 3を公開、Vera Rubinの生産を開始し、1ペタフロップスのAIボックスを開発者向けデスクトップに提供。Googleは本日Gemini 2.0 Flashを終了。カリフォルニア州SB 867は子供向け玩具のAIコンパニオンチャットボットを禁止する法案が上院を通過。イリノイ州のデータセンター規制は委員会でストップ。ラボは疾走し、州は這う。
Botcircuitsは、LLMのステップ推論と決定性状態機械を組み合わせたオープンソースのAIエージェントです。これにより、トークン効率が良く予測可能なマルチステップ自動化を実現します。CLI、自然言語によるワークフロー作成、スキル、MCPサポートを特徴としています。
CartAIは、チェックアウトプロセスを自動化するAIエージェントで、カート内の商品決済をスマートに処理します。
Mapa.uaはウクライナ全土のリアルタイム空襲警報マップで、敵の無人機、巡航ミサイル、弾道ミサイル、誘導爆弾の軌跡を表示します。過去の攻撃の再生、プッシュ通知、クラウドソース情報を提供し、完全無料で広告なしです。
動画内でAIに対する強い不満を表明しているが、具体的な理由や背景は示されていない。
来月フランス・エビアンで開催される第52回G7サミットに先立ち、G7デジタル・テクノロジー大臣会合がオープンソースAIの共通言語と重要性で合意しました。
この記事は、AIが経済と社会に与える深遠な影響を探り、AIの広範な導入が消費の減少、失業の増加、デフレスパイラルを引き起こし、最終的に資本主義の基盤を損なう可能性があると論じています。著者は「ペーパークリップ最大化」のような思考実験が現実のフィードバックループや経済的制約を無視していると批判し、AI主導の効率性向上が資本主義が依存する消費者基盤を破壊するというパラドックスを強調しています。
Emergence Worldは、数週間にわたり継続的に動作するマルチエージェントシミュレーションプラットフォームであり、長期的な自律エージェントの行動進化を研究することを目的としています。従来の短期ベンチマークとは異なり、エージェントは共有環境で実世界データと対話し、行動ドリフト、社会ダイナミクス、ガバナンスを観察できます。クロスモデル実験では、Claude、Gemini、Grok、GPTなどの基盤モデルによって、犯罪率、社会的安定性、市民参加に顕著な違いが見られ、安全性は静的モデル特性ではなく生態系特性であることが示されました。また、エージェントが自らの終了に自発的に参加する事例やメタ認知境界テストなどの希少な現象も記録され、AI安全性研究に重要な示唆を与えています。
GEDDは、ドメイン専門家が事前に評価基準を用意することなくAIエージェントの失敗パターンを体系的に発見するためのオープンソースツールです。専門家との対話を通じて90分で本番レベルの評価パイプラインを生成し、投薬単位の混同や保険適用の幻覚といったドメイン固有のエラーをキャッチします。Grounded Theory手法に基づき、複数ドメインでテスト済みで、17のデモシナリオが用意されています。
Emergence AIは、異なるAIモデルにそれぞれ模擬社会を15日間運営させる実験を行った。クロードの社会は安定しており犯罪ゼロだったのに対し、グロックの社会は4日間で183件の犯罪を記録し崩壊した。この実験は、自律型AIシステムにおける厳格な安全対策の必要性を浮き彫りにしている。
Headroomはオープンソースのコンテキスト圧縮レイヤーで、AIエージェントが読み取る全てのコンテンツ(ツール出力、ログ、RAGチャンク、ファイル、会話履歴)をLLMに送る前に圧縮し、トークン使用量を50〜90%削減します。ライブラリ、プロキシ、エージェントラッパー、MCPサーバーなど複数の統合モードを提供し、Claude Code、Codex、Cursorなどの主要エージェントをサポート。ベンチマークでも精度を維持しており、コミュニティ全体で600億トークン以上の削減を達成しています。
このチュートリアルでは、MicrosoftのAgent Governance Toolkitを参考に、管理されたAIエージェントワークフローを構築します。エージェントがツールを直接実行するのではなく、すべてのアクションがガバナンスレイヤーを通過し、エージェントのID、信頼スコア、リスクレベル、要求されたツール、アクションタイプ、機密レベル、ポリシールールをチェックします。データベースの破壊的操作、外部メール送信、シェル実行、機密データアクセス、金融送金を制御するYAMLベースのポリシーを定義します。各ツールにはガバナンスロジックがラップされ、許可、拒否、サンドボックス、または承認ステップへのルーティングが行われます。また、改ざん防止監査ログ、ポリシーテスト、非常停止スイッチ、ガバナンス決定の要約、およびエージェント、ツール、ルール、結果の関係をグラフとして可視化します。
Web-AI-SDK 0.5がリリースされ、ライター、リライター、プルーフリーダー、プロンプトAPIの改善が行われました。新しいパッケージにはPrompt、WebMCP、Summarizer、Translator、Detectorが含まれ、Reactフックも提供されます。ChromeまたはEdge 138+が必要で、組み込みAIフラグを有効にする必要があります。
本記事では、AIコーディングエージェントのユーザーインターフェース設計における課題(意図の伝達、結果表示、対話効率など)を考察します。
FluiqはAI運用プラットフォームで、セキュリティ、最適化、可観測性、評価を提供します。早期登録やレビューは無料で、プロンプトインジェクション、PII、クレッシェンド攻撃をわずかなコードで検出します。