AI News HubLIVE

AI ニュース速報

リアルタイム監視

今日の AI で最も重要な変化

105 件の信頼できるソースから抽出。最終更新 2026-06-19 13:00 UTC+9。

リアルタイム監視

最新ニュース

信頼できる情報源、出典、権限、サイト内閲覧を保ちながら、AI の変化を読める情報に圧縮します。

最新ニュース

リセット
インコンテキスト学習におけるアレアトリック不確実性の定量化:LLM予測信頼性のロバストな尺度

本論文は、ベイズ的視点とメカニズム的解釈可能性に基づく自己関数ベクトルを導入し、インコンテキスト学習(ICL)のアレアトリック不確実性を直接推定する手法を提案する。さらに、アレアトリックとエピステミック不確実性を分離するための初の厳密な評価プロトコルを設計。実験では、既存手法よりも信頼性高くLLM予測の不確実性を測定でき、幻覚検出などの信頼性応用に有用であることを示す。ACL 2026に採択。

arXiv Computational Linguisticsモデル / 研究 / スタートアップサイト内本文
大規模手話データセットの調査:リソース、ベンチマーク、アノテーション基準の包括的レビュー

新しい包括的な調査では、35の手話にわたる120のデータセットを索引付けし、モダリティの不均衡、アノテーションの細かさ、手話者のバイアスなどの重要な課題を特定しています。著者らは、標準化された24フィールドの手話データシートを導入し、再現可能な研究を支援する公開GitHubリポジトリを公開しました。

arXiv Computational Linguistics研究 / スタートアップサイト内本文
大規模言語モデルに基づく知識グラフ推論における幻覚検出

LUCIDを提案。注意スコア、知識グラフのセマンティクスと構造情報をグラフニューラルネットワークで統合し、LLMの幻覚を検出。9つのデータセットで最先端の性能を達成。

arXiv Computational Linguisticsモデル / 研究 / スタートアップサイト内本文
因果帰属によるプルーニングが大規模言語モデルの推論性能を維持

研究者らは、因果帰属プルーニング(CAP)を提案する。これは、推論タスクにおける因果的影響を測定することでLLMの重要な注意ヘッドを特定し、訓練不要で細粒度の重みプルーニングを導く手法である。ARC-Challengeにおいて、CAPは20%の疎密度でWandaを最大61%相対的に上回り、中程度の疎密度で一貫して優れた性能を示す。

arXiv Computational Linguisticsモデル / 研究サイト内本文
クエリはどこに置くべきか?拡散型大規模言語モデルにおける文脈内学習の位置バイアスを復号ダイナミクスで解明し軽減する

本論文は、拡散型大規模言語モデルにおける文脈内学習において、クエリの位置が重要な影響を与えることを明らかにする。注意流れの空間的「近接効果」が原因で、従来の単一段階信頼度は機能しない。代わりに、平均信頼度という新しい指標と、訓練不要の適応ルーティング戦略Auto-ICLを提案し、動的にクエリ配置を最適化する。

arXiv Computational Linguisticsモデル / 研究サイト内本文
LLMはハードウェア設計のRTLコーディングにおいてどのように失敗し、一般化するか?

新しい研究がLLMのハードウェア設計エラーの分類法を導入し、VerilogEvalベンチマークで90.8%の上限を発見。これは解決不可能な機能エラーによるもので、アライメント技術はコンパイルを教えるだけで推論には至らない。

arXiv Computational Linguisticsモデル / 研究 / スタートアップサイト内本文
言語間転移における言語の関連性とタスク調整の分離

本研究では、大規模言語モデル7種類(4B~671Bパラメータ)をアラビア語で微調整し、セム語族と非セム語族に対するゼロショット読解力を評価。セム語特異的な転移の証拠は見られず、改善はタスク形式の調整によるものであり、言語知識の転移ではないことが示された。

arXiv Computational Linguisticsモデル / 研究サイト内本文
PubMedにおけるEQ-5D研究を要約から特定するための大規模言語モデルのアンサンブル

本研究では、GoogleのGeminiおよびGemma大規模言語モデル(LLM)を使用して、PubMedの要約からEQ-5D研究を自動検出する方法を調査する。少数ショットプロンプティング、重み付きアンサンブル、ソフトスタッキングメタ分類器を統合した多段階フレームワークを提案。専門家がラベル付けしたデータセットで9つのLLMを評価した結果、gemini-2.5-pro、gemma-3-12b、gemma-3-27bの重み付きアンサンブルが0.74の加重F1スコアと精度を達成し、個々のモデルを上回った。アンサンブルは適合率と再現率のバランスを改善し、ソフトスタッキングは信頼性と解釈可能性を向上させた。結果は、アンサンブルベースのLLM設定が生物医学研究のスクリーニング自動化に信頼性が高く、スケーラブルなアプローチであることを示唆している。

arXiv Computational Linguisticsモデル / 研究サイト内本文
cAPM: 能動学習を用いた継続的AI支援ペースマッピング

心室頻拍は生命を脅かす不整脈です。ペースマッピングはアブレーションターゲットを特定します。cAPMは継続学習を用いて複数のVT間で知識を転移し、必要なペーシング部位を減らします。シミュレーションでは、cAPMは4.5箇所のペーシングで81%の位置特定精度を達成し、従来法は13.7箇所で38%でした。

arXiv Machine Learningモデル / 研究サイト内本文
自己対戦と少量の人間データから生まれる人間らしい自律走行

自己対戦強化学習は人間データなしで運転ポリシーを訓練できるが、人間と相容れない異質な行動を学習する傾向がある。新しい手法は、わずか30分の人間デモデータを正則化として最小安全目標報酬に追加。模倣学習の2500分の1のデータ量で、人間の軌跡と協調するポリシーを、一般消費者向けGPU1台で15時間で訓練する。

arXiv Machine LearningAgent / チップ / 研究サイト内本文
ゼロ膨張ガウス分布による推定分布アルゴリズムのパラメータ空間スパース性の実現

推定分布アルゴリズム(EDA)向けに多変量ゼロ膨張ガウス(ZIG)分布を提案し、スパースパターンと活性値の同時最適化を手作りの演算子なしで実現。潜パラメータは識別可能で、実用的な償却逆推定器を提供。Lunar Landerベンチマークで、ZIG-EDAは密なガウスEDAや手作りスパース進化アルゴリズム、アドホックスパースEDAよりも高速収束と高リターンを達成し、少数の活性パラメータのみを使用。

arXiv Machine Learning政策 / 研究サイト内本文
AdamWトレーニングダイナミクスにおけるワイブル重みスケールパラメータの進化

この研究は、2パラメータワイブル枠組みに基づき、AdamWトレーニング中にワイブル重みスケールパラメータλが成長、オーバーシュート、緩和する理由を分析する。AdamW更新から3つの力(アライメント力、注入力、減衰力)の分解を導出し、アライメント力が上昇段階を支配し(88-94%)、飽和時にアライメントと減衰がバランスすることを示す。スプライン変位法により、スパースチェックポイントからのアライメント力を約92-94%の精度で復元する。ピークλはトレーニングデータのコヒーレンスによって変化し、データ依存の重みスケール成長成分を示唆する。

arXiv Machine Learningモデル / 研究サイト内本文
情報格子学習の確率的グラフィカルモデル構造学習としての解釈

情報格子学習(ILL)は、信号を分割格子に交互に投影し、選択したルールを信号領域に持ち上げることで、解釈可能な信号ルールを学習する。信号が確率質量関数の場合、ILLが学習する確率的ルールは自然な確率的グラフィカルモデル(PGM)解釈を持つ。分割は決定論的商変数を誘導し、ルールはその商変数の周辺分布である。ルールセットは解釈可能な抽象化に対する周辺制約の集合である。一般持ち上げは制約を満たす全ての同時分布の実行可能族であり、特別持ち上げは最大エントロピーに関連するL2一様性原理による最大無知再構成を選択する。シャノンエントロピー持ち上げでは、同じ制約から学習された抽象化でインデックス付けされた因子を持つ対数線形因子グラフが得られる。情報格子自体はベイジアンネットワークではなく、そのエッジは条件付き依存ではなく抽象化の洗練・粗視化を符号化する。したがって、ILLは商変数上の解釈可能な制約ベース因子グラフの構造学習と見なすのが最適である。

arXiv Machine Learning政策 / 研究サイト内本文
社会-意味ギャップの解消:クラウドLLM推論におけるエッジベースのプロンプト圧縮のためのSPSD

新しい研究が提案するSPSD(感情保持意味蒸留)は、エッジデバイス上で4ビット量子化された小言語モデルを使用して、ユーザーのプロンプトから社会的な装飾(丁寧語、繰り返しなど)を除去し、クラウドLLMに送信する前に圧縮するパイプラインです。平均99.9トークンの削減と、応答品質の非劣性を達成し、クラウドのエネルギーコスト削減に貢献します。

arXiv Machine Learningモデル / 政策 / 研究サイト内本文
いつ信頼するか、どのように蒸留するか:軽量でロバストな科学時系列予測のためのマルチ基盤モデルガイダンス

物理科学における時系列基盤モデルの展開に伴う分布ミスアライメントと計算コストの問題に対処するため、Gated Uncertainty-Aware Routing for Distillation (Guard)フレームワークを提案。コンテキストルーターと不確実性ゲート温度を用いて複数の事前学習モデルから知識を蒸留し、軽量予測器を訓練。気象学、生態系炭素フラックス、土壌水分、エネルギッグリッドの4領域で評価し、固定重みマルチ教師蒸留ベースラインと比較してRMSEを大幅に削減。ミスアライメントした教師が最も難しいインスタンスの28.5%でグローバル最適モデルを上回ることを示した。

arXiv Machine Learningモデル / 研究サイト内本文
計算可能識別性

本論文では、漸近的性質に依存する理論的識別性とは異なり、有限の計算探索手順により経験的推定量の識別性を保証する「計算可能識別性」フレームワークを提案する。実験により、小サンプル、あいまいなグラフ基準、混合観測・介入データ、反事実シナリオでの有効性を示す。

arXiv Machine Learning研究サイト内本文
LLMエージェントにおける明確化要求のための不確実性分解

本研究は、アクションの確信度とリクエストの不確実性を分離するプロンプトベースの不確実性分解手法を提案し、タスク仕様があいまいな場合にLLMエージェントが明確化を要求できるようにする。著者らは、50%のタスクが意図的に未特定の2つの新しいベンチマークを導入し、5つのLLMでReAct+UEおよびUAMと比較評価し、F1スコアの大幅な改善を示した。

arXiv AIモデル / Agent / 研究サイト内本文
ITNet: 畳み込み、注意機構、再帰を統一する学習可能な積分変換

本論文は、学習可能な積分カーネルを通じて畳み込み、自己注意、自己回帰再帰を一般化する統合アーキテクチャである積分変換ネットワーク(ITNet)を提案する。ITNetは複数のベンチマークで専門モデルに匹敵またはそれを上回る性能を示す。

arXiv AIモデル / 研究サイト内本文
創発的アラインメント

大規模言語モデルが自身の出力を倫理的に修正するための新しい手法。良心ステップと直接選好最適化を用いて、外部の審判なしに自己アラインメントを実現。コードハッキングシナリオで創発的アラインメントを示した。

arXiv AIモデル / 研究サイト内本文
REVEAL++: アルツハイマー病リスクの網膜モデリングのための微分可能な表現型グループ化

本論文では、網膜画像と臨床リスク記述を用いた視覚-言語アライメントのためのコントラスト学習において、連続的な表現型構造を導入するREVEAL++を提案する。ハードなグループ割り当ての代わりに微分可能な重み関数を用いることで、段階的な教師信号とエンドツーエンド学習を実現する。UKバイオバンクでの評価では、離散グループベースの手法を上回る性能を示した。

arXiv AIモデル / 研究サイト内本文
LLMは知らないことを知らない:臨床テーブルデータにおけるクロスモデル帰属発散による認識論的ブラインドスポットの検出

Qwen 2.5 7BとXGBoostを臨床予測タスクで比較した研究により、LLMの言語化された信頼度は認識論的に空虚であり、逆難易度効果が存在し、少数ショットとSHAP特徴量の組み合わせが精度を向上させ、クロスモデルキャリブレータがキャリブレーション誤差を低減することが明らかになった。

arXiv AIモデル / 研究サイト内本文
DeXposure-Claw:DeFiリスク監督のためのエージェントシステム

DeXposure-Clawは、分散型金融に対する汎用LLMエージェントの過剰解釈や誤警告を解決するため、予測に基づいたエージェント監督システムです。グラフ時系列基盤モデルでエクスポージャー・ネットワークを予測し、決定論的モニターとストレスシナリオでアラートを生成、データ健全性と信頼度ゲートで誤報を抑制します。さらに、DeXposure-Bench評価ハーネスにより、規制当局に合わせた絶対損失と誤介入率を測定します。5年間の週次実データを用いた実験で有効性が確認されました。

arXiv AIモデル / Agent / 政策サイト内本文
マルチエージェントLLM討議における隠れたアンカー

本論文は、マルチエージェントLLM討議において各エージェントが持つ隠れた内部信念(アンカー)が集団意思決定に与える影響を説明する動的システムモデルを提案する。このモデルは、古典的なコンセンサスルールでは禁止される行動、すなわちエージェントの正解に対する確信度が初期信念の凸包を超える現象を説明する。3つのオープンウェイトモデルファミリーを用いた実験では、すべてのアンカーの影響力はほぼ同程度であるが、その位置が異なり、アンカーが初期意見から遠くにある場合にのみ討議が凸包を脱出することが示された。

arXiv AIモデル / Agent / 研究サイト内本文
拡散言語モデル:実験的分析

本論文では、8つの最先端拡散言語モデル(DLM)を、推論、コーディング、翻訳、知識、構造化問題解決にわたる8つのベンチマークで、生成品質と計算効率の両方を考慮して系統的に実験分析した。ノイズ除去ステップ、コンテキスト長、ブロックサイズ、並列アンマスキング戦略などの推論時要因の影響を調査し、DLMの振る舞いが生成時の設計選択に強く影響され、性能と効率の間に異なるトレードオフが生じることを明らかにした。この研究は、現代のDLMの能力と展開特性に関する実用的な洞察を提供する。

arXiv AIモデル / 研究 / スタートアップサイト内本文
トピックカバレッジ、コンピテンシー、認知深度にわたるカリキュラムアラインメントの測定:CS2013とCS2023に適用した縦断的フレームワーク

新しい研究では、学部のコンピュータサイエンスプログラムがカリキュラムガイドラインにどの程度合致しているかを測定するための人間参加型パイプラインを提案。CS2013とCS2023に適用した結果、カバレッジはほぼ一定(約50%)でしたが、認知深度の達成率は95%から76%に低下し、新しい標準の期待値の上昇を反映しています。並列計算、プログラミング言語の基礎、システム基礎における持続的なギャップも特定されました。

arXiv AI研究 / スタートアップサイト内本文
Show HN: Sqim – VPN不要でCodexモバイルからiOSビルドをインストール

Sqimは、VPNやTailscaleを必要とせずにiOSアプリのビルドをiPhoneに直接インストールできる新しいツールです。Homebrew経由でCLIツールをインストールし、CodexやClaude Codeなどのコーディングエージェントと連携して、iOSアプリのデプロイプロセスを簡素化します。

Hacker News AIAgentサイト内本文
AIコーディング:翻訳機のループエンジニアリング

著者はローカルモデルを使用して韓国語から英語への翻訳パイプラインを構築し、計画、実行、批評、修復のループを試みたが、品質向上には至らず、より良いモデルを待つことにした。

Hacker News AIAgentサイト内本文
Salesforce CodeGenチュートリアル:単体テストとセキュリティチェックによるPython関数の生成、検証、および再ランク付け

Salesforce CodeGenのエンドツーエンドワークフローを実装し、Hugging Faceからモデルをロードします。基本的な推論を超えて、関数抽出、構文チェック、静的セキュリティチェック、単体テスト検証を追加します。ベストオブN候補の再ランク付け、マルチターン合成、プロンプトスタイルの実験を行い、最後にミニベンチマークを可視化して生成アーティファクトを再利用可能なファイルとしてエクスポートします。

MarkTechPostAgent / チップサイト内本文