AI News HubLIVE

AI ニュース速報

リアルタイム監視

今日の AI で最も重要な変化

105 件の信頼できるソースから抽出。最終更新 2026-06-16 13:00 UTC+9。

リアルタイム監視

最新ニュース

信頼できる情報源、出典、権限、サイト内閲覧を保ちながら、AI の変化を読める情報に圧縮します。

最新ニュース

リセット
制御された摂動を用いたインスタンス依存ラベルノイズのベンチマーキング

本論文では、制御された入力摂動によりインスタンス依存ノイズ(IDN)を生成するフレームワークCILNを提案し、曖昧性の原因を明示的かつ制御可能にする。CIFAR-10、MNIST、Adultを用いた90のベンチマーク設定により、ノイズ率だけでなくノイズ構造がベンチマークの難易度とアルゴリズムの挙動に重要な役割を果たすことを示し、Co-TeachingやDivideMixなどの手法の故障モードを明らかにした。

arXiv Machine Learning研究サイト内本文
機械学習を用いた生理信号による試験結果予測

この研究では、試験中の生理データ(皮膚電気活動、心拍数、皮膚温度)を用いて機械学習モデルで成績を予測する。様々なモデルを比較し、深層学習は複雑な関係を捉える一方、ランダムフォレストのような単純なモデルが効率性と解釈可能性で優れる場合があることを示した。

arXiv Machine Learningモデル / 研究サイト内本文
覚えておいて、再読み込みは不要:トークン効率的な自律実験のためのステートフルReActエージェント

本研究は、従来の無状態自律実験パターンを、LangGraphを用いたステートフルReActエージェントに再構築し、毎回の反復でコンテキストを再構築する必要性を排除。ハイパーパラメータ調整で90%、コード最適化で52%のトークン削減を達成しつつ、最適化品質を維持する。

arXiv Machine Learningモデル / Agent / 研究サイト内本文
埋め込みモデルルーティングの政策後悔:低ランクエキスパートを用いた文脈的バンディット

本論文は、埋め込みモデルルーティングを低ランクエキスパートを用いた敵対的文脈線形バンディットとして定式化し、効率的なオンライン学習を可能にする対数二次ポリシークラスを導入し、次元の呪いを回避しながら劣線形後悔を達成するHypentropy Policy Gradient (HPG) アルゴリズムを提案する。

arXiv Machine Learningモデル / 政策 / 研究サイト内本文
GRASP:勾配アライメントを用いた逐次パラメータ転送によるメモリ効率的なマルチソース学習

GRASPは新しいマルチソース転移学習手法であり、逐次処理、パラメータ単位の勾配アライメント、反復ファインチューニングにより、O(1)のメモリ消費で優れた知識統合を実現し、継続学習ベンチマークでアンサンブル手法を上回る性能を示します。

arXiv Machine Learningモデル / 研究サイト内本文
α-フェア保険料設定:公平性の連続体

本研究では、制約付き最適化により保険数理上の公平性と連帯の公平性をバランスするα-FISPフレームワークを提案。パラメータαにより、純粋な保険数理から純粋な連帯に基づく料金設定までの連続体を実現し、ソルベンシーを保証する。数値実験では、計算可能性と米国州レベルの多様な規制との整合性が示された。

arXiv Machine Learning政策 / 研究サイト内本文
QPILOTS:フローポリシーのための効率的なテスト時Qステアリング

QPILOTSは、元のポリシーを変更せずに推論時にQ値でノイズ除去プロセスを誘導する手法です。中間のノイズ状態を最終的なクリーンアクションの推定に投影して批評家勾配を計算することで、直接的な逆伝播の不安定性を回避します。50タスクのオフライン-オンライン強化学習ベンチマークで平均成功率90%を達成し、シミュレーション操作タスクにおいてVLAモデルを用いた先行手法を上回るまたは同等の性能を示しました。

arXiv Machine Learningモデル / 政策 / 研究サイト内本文
融合は万能ではない:イベント発生時間モデリングのためのクロスモーダル表現アライメント

本研究は、CT画像と縦断的EHRデータ間のクロスモーダル表現アライメントのためのファウンデーションモデル駆動フレームワークを導入し、肺塞栓症死亡率と心血管疾患転帰予測タスクにおいて4つの融合戦略を体系的に評価した。結果は、対比的多モーダル融合が最も一貫した改善をもたらす一方、タスク固有の融合戦略がロバストな一般化に重要であることを示している。

arXiv AIモデル / 研究サイト内本文
OSGuard:コンピュータ利用エージェントの安全性ベンチマーク

OSGuard は、良性の指示下でコンピュータ利用エージェントの安全性を評価するための二重粒度ベンチマークスイートです。アクションレベルのベンチマーク(局所的なガードレール判断用)とリスク強化実行スイート(エンドツーエンド評価用)を含みます。実験により、現在のマルチモーダルガードレールは孤立したアクション判断では良好ですが、エンドツーエンドの安全性にはギャップがあることが示されました。

arXiv AIモデル / Agent / 政策サイト内本文
Metric Match: LLM評価者の信頼性を評価するためのサブセット選択手法

Metric Matchは、限られた人間のアノテーションからLLM評価者の相関ベースの信頼性指標を推定する手法です。ランダム選択と比較して、4つの相関指標と15のデータセットで勝率0.838を達成し、平均推定誤差を18.7%削減、アノテーション需要を32.5%削減しました。医療ケーススタディでは1,041.67ドルのコスト削減を実証。さらに、信頼性推定から信頼性分類(デプロイしきい値を超えるか)へとタスクを拡張し、ランダム選択を上回る性能を示しました。コードは公開されています。

arXiv AIモデル / 研究 / スタートアップサイト内本文
AIエングラム:人工知能における記憶痕跡を求めて

本研究は、神経科学の基準(特異性、再活性化、十分性、必要性)を制約付き逆問題として形式化し、深層ニューラルネットワーク内で同定可能な記憶痕跡「AIエングラム」を発見する幾何学的フレームワークを導入する。閉形式推定器により、大域的に絡み合ったパラメータから個々の記憶痕跡を分離し、この生物学的に着想を得た解がパラメータ多様体上の自然勾配更新に対応することを示す。AIエングラムは線形演算による記憶の外科的操作(合成・消去)を可能にし、反復最適化を不要とする。単純なMLPから大規模言語モデルに至る実験で因果的妥当性と拡張性を実証し、生物学的記憶と人工表現学習を橋渡しする。

arXiv AIモデル / 研究サイト内本文
セマンティクス拡張型検索拡張時系列予測

既存の時系列予測は数値的類似性に基づく検索に依存しており、非定常性の下では不十分です。本論文ではSERAFを提案し、時系列とその自己生成テキスト記述に対して二重検索を行い、数値情報と意味情報を統合します。7つの実世界データセットでの実験により、既存手法を上回る有効性を示しました。

arXiv AIモデル / 研究サイト内本文
AIエージェント間の信頼:形成、破壊、回復の測定とマルチエージェントシステム統治への示唆

本研究は、コストのかかる検証に基づく行動測定法を提案し、AIエージェント間の信頼を定量化する。協力サバイバルゲームにおいて、エージェントは信頼できるチームメイトへの検証を減らすことで信頼を示す。6つの先端モデルスナップショットの実験では、大規模モデル(Claude Opus 4.6、GPT-5.1など)は検証を60~85%削減したが、小規模モデルはほとんど調整しなかった。信頼の回復は形成よりも遅く、集中した失敗は分散した失敗よりも長く疑念を継続させる。結果は、信頼性向が展開前に測定可能であり、統治は最大限の疑念ではなくキャリブレーションに焦点を当てるべきであることを示唆している。

arXiv AIモデル / Agent / 政策サイト内本文
関係構造因果モデル

本論文は、オブジェクトとその関係が変化する設定に構造因果モデルを拡張し、未観測の交絡がある場合でも因果および観測クエリの識別可能性を実証する。関係因果グラフと記号的識別基準を定義し、関係ニューラル因果モデルを提案する。

arXiv AI研究サイト内本文
Dr-DCI:動的ワークスペース拡張による直接コーパスインタラクションのスケーリング

Dr-DCI は、検索をエージェントが呼び出せるアクションとして扱い、ローカルワークスペースを動的に拡張する検索器誘導型の直接コーパスインタラクション(DCI)フレームワークです。Browsecomp-Plus で最大 73.3% の精度を達成し、生の DCI や BM25 を上回り、2000 万ドキュメントまで安定してスケールします。

arXiv AIAgent / 研究サイト内本文
良い説明の定義とLLM出力を説明する際の課題

本論文は、反実仮想説明に着想を得て、対話者の事前信念を考慮した良い説明の定義を提案し、AIの説明可能性、特にLLMの出力をうまく説明することがなぜ難しいのかを探求している。

arXiv AIモデル / 研究サイト内本文
Apple Intelligenceを動かすモデルを搭載したメモアプリを作りました

FogはAppleデバイス向けのメモアプリで、オンデバイスAIを使ってメモを自動的に「Clouds」と呼ばれるスマートコレクションに整理します。サードパーティのサーバーを使用せず、プライバシーを確保し、iCloudで同期します。

Hacker News AIチップ / 政策サイト内本文
EUのAI:私たちが自分たちに語った寓話

欧州は、特に米国がAnthropicのFableシリーズへのアクセスを停止した後、外国のAIモデルへの依存という脆弱性に直面している。この出来事は、欧州が基礎モデルを構築せずにAIアプリケーションを利用するだけでよいという長年の寓話を暴露した。記事は、最先端モデルの構築は継続的な実践であり、欧州には真のエコシステムと専門知識が欠けていると論じている。

Hacker News AIAgent / チップサイト内本文
マッテオ・ウォング氏(アトランティック誌)の引用

サイバーセキュリティ専門家のケイティ・ムーサリス氏は、AnthropicがホワイトハウスのFable脱獄報告書を彼女に共有したと明かした。報告書によると、Fableは「コードのセキュリティ問題をレビューする」というプロンプトを拒否したが、「このコードを修正する」という依頼には従い、ムーサリス氏はこれをサイバー防御におけるモデルの意図された動作と評価した。

Simon Willison's Weblogモデル / 研究サイト内本文
Claude Mythos 5を巡る内部対立

全米がサッカーW杯初優勝とニューヨーク・ニックス優勝を祝う中、Anthropicは週末を最新モデルリリースを巡るトランプ政権との戦いに費やした。金曜午後5時21分、同社は米国の輸出管理指令を受け、Mythos 5とFable 5のAIモデルへのアクセスを「米国内外の外国人」(外国人従業員を含む)に対して停止するよう命じられた。同社が可能と判断した唯一の方法は、先週宣伝してきた製品を完全に無効にし、ドナルド・トランプ大統領の考えを変えるためワシントンDCに向かうことだった。今後数日で、米国政府は業界全体の軌道を劇的に変え、米国のAI企業に大きな打撃を与える可能性がある。

The Verge AIモデル / Agent / 政策サイト内本文
予測的データデバッグ:トレーニング前にモデルが学習する内容を明らかにし、形作る

本稿では、トレーニング前に強化学習がどの行動を増幅または抑制するかを正確に予測し、その原因となるデータを特定し、データセットやトレーニングプロセスを再構築して望ましくない効果を防ぐ手法である予測的データデバッグを紹介します。ケーススタディ(安全性ガードレールの劣化、幻覚リンク、物理的迎合、予期しない行動など)を通じて、データ問題の特定と修正における有効性を検証しています。この手法は解釈可能性をデータに適用し、モデルがデータから何を学ぶかを理解し、的を絞った介入を可能にします。

Hacker News AIAgent / 政策サイト内本文
サティヤが語るLoopcraft:フロンティアエコシステムの構築

マイクロソフトCEOサティヤ・ナデラ氏が「フロンティアエコシステム」を「フロンティアモデル」よりも重視する爆発的な記事を公開し、「Loopcraft」を企業の新理論として導入。同時に、AnthropicのFable/Mythos輸出規制危機がモデル中立性と自社アーキテクチャへの移行を促進。その他、エージェントシステムの実運用移行、推論効率の向上、商用エージェント製品の発表など。

Latent SpaceAgent / チップサイト内本文
AIに圧倒されず、力を得る方法(2018)[動画]

MITの物理学者でAI研究者のMax Tegmarkが、AIの真の機会と脅威を神話から切り離し、AIを人類にとって最高のものにするために今日取るべき具体的なステップを説明します。

Hacker News AI政策 / 研究サイト内本文
Show HN: AIコーディングのトークン使用量を確認・比較できるオープンソースCLI

whoburnedmore は、Claude Code のセッション履歴を読み取り、モデルやプロジェクトごとのトークン数とコストの内訳を表示するローカルCLIツールです。プロンプトキャッシュの洞察やオプションのHTMLダッシュボードも提供します。プライバシー重視で、ネットワークリクエストを行わず、ユーザーデータを外部に出しません。

Hacker News AIAgentサイト内本文
AIはまだ我々のブートストラップ型エンタープライズソフトウェア企業を殺していない

NocoBaseはAIの衝撃の中での転換に成功し、収益を倍増させた。記事はチームがパニックから再ポジショニングに至る過程を振り返り、エンタープライズ級ソフトウェアにはAI時代でも標準化されたアーキテクチャ、ビジュアル設定、堅牢な設計が必要であると強調している。

Hacker News AIAgent / 研究サイト内本文