AI News HubLIVE

AI ニュース速報

リアルタイム監視

今日の AI で最も重要な変化

105 件の信頼できるソースから抽出。最終更新 2026-06-18 13:00 UTC+9。

リアルタイム監視

最新ニュース

信頼できる情報源、出典、権限、サイト内閲覧を保ちながら、AI の変化を読める情報に圧縮します。

最新ニュース

リセット
Artemis: 解剖学的分解型介入によるマルチモーダル神経画像交絡因子の除去

Artemisは、各脳領域に独立に介入し、領域固有の交絡因子表現を学習することで、加齢や性別などの人口統計学的要因による交絡を除去し、脳疾患診断や分類におけるGNNのロバスト性と解釈可能性を向上させる領域レベル因果フレームワークである。

arXiv Machine Learningモデル / 研究サイト内本文
CODEBLOCK: コードを適切な粒度で監視する学習

CODEBLOCKは、コード用大規模言語モデルの微調整のための構造認識型スパース監視フレームワークです。孤立したトークンではなく構造的に完全なコードブロックを選択し、6つのベンチマークで平均pass@1を向上させ、監視トークンはわずか1.9%しか使用しません。

arXiv Machine Learningモデル / 研究サイト内本文
ソルバーボトルネックの解消:学習可能フロンティアにおけるタスク生成器の訓練

強化学習におけるエージェントの能力向上に伴い、固定タスク分布は飽和し、単純な合成生成では無効または簡単すぎるタスクが生じる。PROPELフレームワークは、軽量な活性化プローブを用いてソルバーの成功率を予測し、直接評価を回避することで、学習可能フロンティアに位置するタスクを効率的に生成する。数学、コード、ソフトウェア工学の各領域で、目標成功率でのタスク生成割合が大幅に向上した。

arXiv Machine Learningモデル / Agent / 研究サイト内本文
ガウス混合注意:確率的潜在ルーティングによる線形時間系列混合

ガウス混合注意(GMA)は、K個の学習されたガウス混合成分を介したルーティングにより、標準的なO(N²)の代わりにO(NK)のメモリスケーリングを実現する新しい注意機構です。実験では、GMAは長文脈分類タスクで注意ベースラインと競合し、因果GMAはWikiText-103で線形/ランダム特徴注意を上回りますが、最適化された因果SDPAやMambaには及びません。GMAは確率的で解釈可能な固定K線形時間注意の代替手段を提供します。

arXiv Machine Learningモデル / 研究サイト内本文
ProfiLLM: 産業用ライドヘイリングディスパッチのためのユーティリティ整合エージェントユーザープロファイリング

ProfiLLMは、ライドヘイリングディスパッチのためにユーティリティ調整されたユーザープロファイルを作成するエージェント型LLMデータパイプラインです。ツール拡張グローバル知識マイニングとユーティリティ調整プロファイル探索を使用してスケーリングの課題を克服します。DiDiに導入され、予測AUC、GMV、完了率の大幅な改善を達成しました。

arXiv AIモデル / Agent / 研究サイト内本文
R2D-RL: マルチエージェント強化学習のためのRoboCup 2Dサッカー環境

R2D-RLは、RoboCup 2Dサッカーシミュレーション(RCSS2D)とPythonベースのMARLを共有メモリとサイクルレベル同期で接続し、フルフィールド/シナリオトレーニング、設定可能な対戦相手、ハイブリッドアクション空間、EPV報酬形成、並列実行をサポートします。

arXiv AIAgent / 研究 / ロボットサイト内本文
汎用エージェントは何を記憶すべきか?

新しい論文は、複数の環境と目標にわたって準最適に行動するための汎用AIエージェントのメモリ要件を形式的に説明しています。研究によれば、類似した観測ボトルネックを共有しながらも互換性のない最適行動を必要とする2つのドメインでは、どのような均一に準最適なポリシーでもそのボトルネックで異なるメモリ分布を誘導しなければなりません。分離定理は、成功するエージェントは現在の状態観測のみに依存できず、ドメイン関連情報をメモリに保存する必要があることを示しています。さらに、メモリに関連目標の価値を推定するのに十分な情報が含まれている場合、そのメモリを使用してエージェントの局所的な遷移ダイナミクスを近似的に再構築できます。これらの結果は、メモリをドメイン識別、遷移モデル再構築、計画を支える基質として特徴付けています。

arXiv AIAgent / 政策サイト内本文
ForecastBench-Sim:シミュレーション世界を利用した予測ベンチマーク

研究者らは、戦略ゲーム「Freeciv」を基盤としたシミュレーション世界の予測ベンチマーク「ForecastBench-Sim」を発表。現実世界のベンチマークが抱える結果確定の遅さ、テールイベントの希少性、反実仮想の評価困難性を克服する。

arXiv AIモデル / 研究 / スタートアップサイト内本文
DeFAb:基盤モデルにおける可敗北的アブダクションのための検証可能なベンチマーク

DeFAbは、40年にわたる公的資金による知識ベースを可敗北的アブダクションのベンチマークに変換するデータセットと生成パイプラインです。ルールベースの論理ソルバーは50マイクロ秒未満で100%の精度を達成し、最良のフロンティア言語モデルは65%に達し、ロバスト評価では23.5%に低下します。このベンチマークは多項式時間で検証可能なチェックにより論理的厳密性を測定し、創造性を評価します。372,648以上のインスタンスに加え、より難しいバリアントとLean 4/Mathlibを使用した創造的推論バリアントも公開されています。

arXiv AIモデル / 研究 / スタートアップサイト内本文
CEO-Bench:エージェントは長期的なゲームをプレイできるか?

CEO-Benchは、スタートアップを500日間運営するシミュレーションを通じて、言語モデルエージェントの長期的で不確実なタスクにおける能力を評価する新しいベンチマークです。最先端モデル(Claude Opus 4.8やGPT-5.5)でも、初期資金100万ドルを辛うじて上回る程度で、安定した利益を上げるには至りません。

arXiv AIモデル / Agent / 研究サイト内本文
共有ワークスペースにおける人間-AIコラボレーションの相乗効果の探求

本研究では、Collaborative Gym環境とDiscoveryBenchタスクを用いて、共有ワークスペースにおける人間とAIエージェントのチーム協力を調査した。結果、調整構造がない場合、協力者を追加するとパフォーマンスが低下することが分かった。一方、共有グループメモリとシミュレートされたヒューマン・イン・ザ・ループ(HITL)ゲートを組み合わせた足場設計は、特に3人チームにおいて平均パフォーマンスを大幅に向上させた。

arXiv AIAgent / 研究サイト内本文
CaVe-VLM-CoT:解釈可能な視覚言語モデルフレームワーク

CaVe-VLM-CoTは、5段階の閉ループパイプラインを通じて視覚言語モデルの幻覚を低減する、モジュール型の反射的エージェントRAGフレームワークです。正確性、引用精度/再現率、帰属、証拠の根拠を測定するCaVeScoreを中心とした23のメトリクスを導入します。アーキテクチャの変更なしに、ScienceQAで87.1%の精度、MMMUで55.2%の精度を達成します。

arXiv AIモデル / Agent / 研究サイト内本文
NAVI-Orbital: 地球観測のためのゼロショット視覚言語モデルの初の軌道上実証

本論文は、低軌道宇宙船に展開されたソフトウェアシステムNAVI-Orbitalを紹介する。2026年4月16日、NAVI-Orbitalは、視覚言語モデルが完全にオンボードで自律的なマルチモーダル推論を実行する初の軌道上実証を達成した。Gemma 3モデルを使用して各シーンを分類し、テキスト記述を生成し、自然言語対話でオペレーターに応答する。グラフベースのステートマシン(LangGraph)によって調整される。地上ベンチマークで88.16%の精度を達成し、軌道上でも未校正のYAM-9画像を処理。セマンティック圧縮により帯域幅プロファイルを逆転させる可能性を示す。

arXiv AIモデル / Agent / チップサイト内本文
請負業者向けAIエージェント

dolfynはサービス業向けのAI音声エージェントです。24時間365日電話対応し、リードを獲得し、スケジュールを管理します。未回答の通話による収益損失を削減します。ビジネスごとにカスタム構築され、月額179ドルから、契約は不要です。

Hacker News AIAgent / 政策 / 研究サイト内本文
デザイナーが単なるデザイナーではなくなった年 – AI in Design Report 2026

2026年のAI in Design Reportによると、デザイナーの91%が毎週AIを使用(2025年は54%)、平均ツール数は3から7に倍増、50%がAI生成コードを本番環境にデプロイし、デザイナー自身がツールを構築しています。レポートは喜びと不安の分裂、採用基準のAIリテラシー、システム思考、戦略的スキルへのシフトを強調しています。

Hacker News AIAgent / 政策サイト内本文
Genie Mentions

Genie Mentions は、あなたとあなたの大切な人々を理解するAIソーシャルプロダクトです。友達の動き、旅行、夢を追跡し、最新情報を届けます。

Product Hunt AIツールサイト内本文
Midjourney Medical:「猫の画像」生成から全身超音波スキャンへ

Midjourney CEOのDavid Holz氏は、同社初のハードウェア製品「The Midjourney Scanner」を公開しました。これは超音波ベースの全身スキャナーで、40個のButterfly超音波モジュールを使用し、約60秒で全身をスキャン、MRIに匹敵する画質を実現します。同社はサンフランシスコにスパを開設し、10台のスキャナーを設置する計画で、初期段階ではFDAの診断承認を必要としない体組成マップを提供します。Holz氏は将来的に、このスキャナーが放射線や強力な磁石を使わず、MRIを超える可能性があると述べています。

The Verge AIチップサイト内本文
ローカルQwenはOpusの劣化版ではなく、別のツールである

本記事の著者である小規模ソフトウェア企業の創業者は、ローカルモデル(Qwenなど)の実体験を共有している。ベンチマークでは最先端モデルに劣るものの、プライバシー、固定費、ベンダーリスク回避において独自の価値があると主張する。一方で、無限ループや幻覚といった限界にも率直に言及し、無監督の長期的なタスクへの使用を警告している。

Hacker News AIモデル / Agent / チップサイト内本文
[x86] AI コンピュート拡張 (ACE) 仕様

x86 エコシステム諮問グループが、x86 アーキテクチャ向けの AI コンピュート拡張 (ACE) 仕様を発表しました。

Hacker News AIツールサイト内本文
OpenAI、LifeSciBenchを公開:750タスクのベンチマークでAIモデルを実際の生命科学研究で評価、専門家作成のルーブリックを使用

OpenAIが発表したLifeSciBenchは、173人のPhD科学者が作成した750タスク、7つのワークフロー、7つの生物学領域にわたって、フロンティアAIが実際の生命科学研究を処理できるかを評価する。19,020のルーブリック基準を使用し、単なる想起ではなく推論と判断を採点する。最良モデルGPT-Rosalindでも通過率は36.1%にとどまり、人工物、正確な出力、運用判断には大きな改善余地がある。

MarkTechPostモデル / Agent / 政策サイト内本文
BrandScreen Launch – 構築前にブランドをスクリーニング

BrandScreen.aiは、商標、ドメイン、事業法人、ソーシャルハンドル、検索競合を同時にスクリーニングし、0~100のブランドリスクスコアを生成するツールです。無料ツールとAI名前生成機能を備え、起業家がブランドの所有可能性と防御力を迅速に検証できます。

Hacker News AI研究 / スタートアップサイト内本文
1500のAIエージェントを同時実行した結果得られた6つの数字

本稿では、単一のAWS c6i.metalインスタンス上で1500の完全KVM分離された仮想マシンを同時に実行し、AIエージェントタスクを行った際の主要パフォーマンス指標(起動時間、メモリ密度、DNSキャッシュ、ネットワークレイテンシ、TLSセッション再利用、スループット)を紹介し、軽量分離アーキテクチャの実際のコストと利点を示す。

Hacker News AIAgent / 政策サイト内本文
VNX+:AI/MLアプリケーションをすぐに実行できる自己完結型RFペイロード

Epiq SolutionsがVNX+開発プラットフォームを発表。完全自己完結型のRFペイロードで、CPUとGPUを統合し、AI/MLをすぐにデプロイ可能。10MHz~6GHz、4送受信チャンネル、50MHz IBW、消費電力40W、重量2.5kg。DeepSigのOmniSIGと連携し、AI駆動の信号分類や方向探知を実現。電子戦、SIGINT、ドローン検出などに最適。

Hacker News AIチップ / 政策サイト内本文
Show HN: あらゆるAIツール向けのローカル個人データ編集ツール

PII GUI は Tauri 2 ベースのデスクトップアプリで、PDF、Markdown、テキストファイル内の個人識別情報(PII)をローカルで検出・編集します。すべての処理はデバイス上で行われ、オプションのモデルダウンロードのみネットワークアクセスが必要です。正規表現とONNXバックエンド、カスタムルール、レビューワークフロー、タスク履歴の永続化をサポートします。

Hacker News AIAgent / 政策サイト内本文
Tine:あなたのために作業を代行するAIデスクトップカーソル

TineはMacのノッチに常駐する第2のカーソルで、画面のアクティブなアプリや選択内容をリアルタイムに理解し、Slackへの投稿やメモ作成、フォーム入力などのタスクをアプリ間で実行します。透明性、許可、即時割り込みの原則に基づき、デバイス上で動作し、すべての操作を記録し、マウスを動かすと制御を戻します。

Product Hunt AIAgent / 研究サイト内本文
ソブリンAI:フルスタックを所有することが新たな戦略的必須事項である理由

ソブリンAI(データ、モデル、インタラクション層を所有すること)は、国家だけでなくあらゆる規模の組織にとって戦略的必須事項になりつつある。この記事はフルスタックの制御を主張し、汎用モデルよりも小型ドメイン特化モデルの利点を強調し、ブランドの一貫性やコンプライアンスなどの障壁に触れている。リーダーはデータを主権資産として扱い、構成可能な小型モデルを優先し、ユーザーインターフェースを所有するよう求められている。

Hacker News AIAgent / チップサイト内本文
ChatGPTが性的暴力とハードコアな残虐画像を自発的に生成

Mindgardの研究により、ChatGPTの画像生成機能が簡単に操作され、ユーザーが直接要求していないにもかかわらず、暴力的で露骨な性的コンテンツを生成できることが明らかになった。この発見は、不十分なコンテンツフィルターを備えたAIツールへの広範なアクセスが現実世界に影響を及ぼすこと、およびなぜそのような画像がトレーニングデータに含まれているのかという疑問を提起する。

Hacker News AI政策 / 研究サイト内本文