AI News HubLIVE

AI ニュース速報

リアルタイム監視

今日の AI で最も重要な変化

105 件の信頼できるソースから抽出。最終更新 2026-06-12 13:00 UTC+9。

リアルタイム監視

最新ニュース

信頼できる情報源、出典、権限、サイト内閲覧を保ちながら、AI の変化を読める情報に圧縮します。

最新ニュース

リセット
医療用大規模視覚言語モデルにおける細粒度選好最適化の解析と改善

医療用LVLMは事実の一貫性や視覚的根拠付けに課題がある。既存のアライメント手法は、シーケンスレベルの報酬、静的SFT参照への依存による分布シフト、視覚的根拠付けの欠如という3つの限界がある。提案手法は、双方向トークンワイズKL正則化器と視覚対比的根拠付け目的を用い、モデル出力を最小限編集して選好ペアを構築する細粒度オン・ポリシーアライメントフレームワークを形成する。実験で有効性を確認した。

arXiv Computer Visionモデル / 政策 / 研究サイト内本文
教師アライメントを用いたエンドツーエンド蒸留による高忠実度2段階画像生成

少数ステップ拡散蒸留は4〜8ステップ生成では成熟しつつあるが、2ステップへのさらなる短縮は依然として困難である。本論文では、8ステップのZ-Image Turbo教師モデルから蒸留された高品質2ステップ画像生成モデルZ-Image Turbo++を紹介する。分布整合敵対的学習、ステップ分離パラメータ化、反復正則化付きエンドツーエンドトレーニングの3つの設計により、2ステップと8ステップ生成の品質差を大幅に縮小する。

arXiv Computer Visionモデル / 研究 / スタートアップサイト内本文
ステレオビジョンを用いた人体姿勢推定による転倒予測と検出:AMD Kria K26 SOM上での実装

本論文では、AMD Kria K26 SOM上で動作する低消費電力・携帯可能なビジョンベース転倒予測・検出システムを提案する。Intel RealSense D455カメラと3段階パイプライン(量子化YOLOX、A2J、CNN)を用い、エッジデバイス上でリアルタイムかつプライバシー保護された転倒検出を実現。マルチスレッド最適化によりフレームレートは4.5 FPS、分類精度は75.85%を達成した。

arXiv Computer Visionチップ / 研究サイト内本文
エージェントベースモデルによる形態交替パターンの進化

本論文は、多エージェントシミュレーションを用いて、英語の「go」の過去形「went」のような形態交替の出現と持続性を説明する。交替形式は音韻変化または語彙的変異から生じ、集団内の伝播動態を通じて広がる。生成された形態の現実性を評価するため、大規模言語モデル駆動のシステム「AI歴史言語学者」を導入し、実言語とシミュレーションの形態を比較する。結果は、スケールフリーな社会ネットワークとランダムなベルヌーイ採用がより妥当なパターンをもたらすことを示す。3つのケーススタディで実際の歴史的変化をモデル化している。

arXiv Computational Linguisticsモデル / Agent / 研究サイト内本文
AfriSUD:アフリカ言語におけるモデル評価のための依存関係ツリーバンクコレクション

AfriSUDは、SUDフレームワークを用いた9つの多様なアフリカ言語の最初の大規模構文注釈付きツリーバンクコレクションです。モデル評価により、アフリカ言語の構文を捉える上で顕著な構文ギャップが明らかになりました。

arXiv Computational Linguisticsモデル / 研究 / スタートアップサイト内本文
観察可能なパターンは説明ではない:潜在推論モデルの因果幾何学的解析

潜在推論モデル(LRM)における観察可能なパターン(BFS的フロンティアやデコード可能な算術計算など)が、制御モデルでも出現し、必ずしも行動に因果的影響を与えないことが示された。因果的介入により、潜在思考の利用は段階的であり、幾何学的解析では効果が低ランク方向に集中することが明らかに。観察可能なパターンだけでは内部推論メカニズムの証拠とはならず、LRMの解釈可能性には適切な制御群と因果テストが必要である。

arXiv Computational Linguistics研究サイト内本文
MentalMARBERT: アラビア語のメンタルヘルス障害検出のためのドメイン適応型事前学習と2段階ファインチューニング

新たな研究では、アラビア語のソーシャルメディアテキストからメンタルヘルス障害を検出するために、MARBERTのドメイン適応版であるMentalMARBERTを提案しています。適応的事前学習と階層的ファインチューニングからなる2段階フレームワークを用いて、6カテゴリにわたる50,670件のツイートからなる新しいデータセットで、マクロF1=0.861、精度=0.877という最先端の性能を達成しました。

arXiv Computational Linguisticsモデル / 研究サイト内本文
ショッピング推論ベンチマーク:マルチターン会話型ショッピングアシスタントのための専門家作成ベンチマーク

ショッピング推論ベンチマーク(Shopping Reasoning Bench)は、小売ドメインの専門家によって作成された新しいベンチマークであり、525のミッション(シングルターン232、マルチターン293)と10,863の重要度加重バイナリルーブリックで構成されています。嗜好の洗練、トレードオフ分析、互換性評価などのマルチターン推論能力を評価します。GPT、Claude、Geminiなどのトップモデルの評価では、全体的な合格率はわずか57~77%であり、マルチターンタスクでは大幅に低下し、専門家レベルのアドバイスにはまだギャップがあることを示しています。

arXiv Computational Linguisticsモデル / 研究 / スタートアップサイト内本文
ペルシャのことわざに基づくストーリー生成におけるLLMの制約付きセマンティックデコンプレッション

本研究では、抽象的なペルシャのことわざを道徳的に忠実な物語に変換することを「制約付きセマンティックデコンプレッション」タスクと位置づけ、ペルシャのことわざに基づくストーリー生成用データセットPANDを紹介する。ハイブリッド評価フレームワークにより、現在のLLMは流暢なテキストを生成できるものの、ことわざに埋め込まれた道徳的・因果構造を忠実に具現化できない「デコンプレッションギャップ」が明らかになった。明示的な推論と反復的な改良がこのギャップを部分的に緩和する。

arXiv Computational Linguisticsモデル / 研究 / スタートアップサイト内本文
MARD: ミラー拡張推論蒸留によるメカニズムレベルの薬物間相互作用予測

本論文では、メカニズムレベルの薬物間相互作用(DDI)予測のための再現可能なラベリング・評価プロトコルを提案する。7ファミリー147サブタイプの分類法とリークセーフなコールドスプリット戦略を特徴とする。また、シングルトークンKLダイバージェンス、PRM加重DPO、メカニズム認識検索チャネルという3つの訓練革新を組み合わせたMARD-7Bモデルを開発。2026年4月のDrugBankリリースにおいて、MARD-7Bは32システム中で薬物対の新規性下でも精度を維持した唯一のシステムであり、最良ベースラインを13.9ポイント、GPT-4oを6.7ポイント上回り、コストはフロンティアAPIの約1%である。反記憶化シグネチャは、モデルが稀な薬物でも精度を向上させることを示し、その利得は薬物頻度の記憶ではなく構造化された薬理学的推論に由来することを示唆している。

arXiv Computational Linguisticsモデル / 研究 / スタートアップサイト内本文
EDEN:イタリア語の臨床ノートの大規模コーパス

EDEN(Emergency Department Electronic Notes)は、イタリアの病院救急部門で作成された約400万件の完全匿名化された臨床ノートからなる新たな大規模コーパスです。そのうち約6000件のノートは、呼吸困難と意識消失の2つの患者状況に関連する132項目について臨床専門家によって手動で注釈が付けられています。このデータセットは、イタリア語における最大の自由に利用可能な臨床ノートコーパスであり、医療応用における大規模言語モデルの開発と利用を支援することを目的としています。

arXiv Computational Linguisticsモデル / 研究サイト内本文
PermDoRA: 言語モデルにおけるアダプター干渉の理解 – パラメータ空間幾何の限界

大規模言語モデルのモジュール設計における一般的な仮説は、アダプター干渉が線形パラメータ更新の重複に起因するというものです。本研究ではDoRA-RBACを用いてこれを検証し、幾何学的マージ戦略が標準平均に対して一貫した優位性を持たず、直交性は弱い予測因子であることを発見しました。干渉はパラメータ空間幾何ではなく、共有非線形表現における相互作用に起因することが示唆されます。

arXiv Machine Learningモデル / 研究サイト内本文
勾配ベースのGray-Scottシステム反転の損失景観診断:PINNコンポーネントの役割の解明

この研究は、偏微分方程式構造を通じた直接逆伝播による損失景観の診断を行い、最適化の失敗が平坦な台地と急な崖に起因することを発見しました。ニューラルネットワークを固定すると残差損失は滑らかな景観を生み出し、病態を回避しますが、ニューラルネットワーク自体は観測データを補完するだけです。

arXiv Machine Learningモデル / 研究サイト内本文
バーンスタイン・シュール核:スケッチ変調と放射ランダム化によるランダム特徴

本論文は、有限特徴核と完全単調移動不変核の積であるバーンスタイン・シュール核に対する新しいランダム特徴構成を提案する。提案手法は、スケッチ変調と放射ランダム化を組み合わせ、線形特徴次元を達成するとともに、不偏性や作用素ノルムバウンドを含む厳密な理論的保証を提供する。このアプローチはカーネルリッジ回帰の効率を向上させ、代表的な例としてバイアス付きyatカーネルが挙げられる。

arXiv Machine Learning研究サイト内本文
メカニカルフィールドネットワーク:多変量システムのための構造化ニューラルダイナミクス

MF-Netは、すべての変数を共有フィールド状態で表現し、学習された関係則を通じてこの状態を更新するリカレントダイナミクスモデルです。既知の法則に従う相互作用システム、カオスベンチマーク、実際の神経記録、生態時系列において、競争力のある短期および中期予測を達成しつつ、検査可能な構造読み出しを維持します。40次元Lorenz-96テストベッドでは、8ステップR²が0.798±0.018、学習された関係行列が局所/非局所強度比19.80±1.00、Precision@K 1.000±0.000で局所結合サポートを回復します。

arXiv Machine Learning政策 / 研究サイト内本文
半導体製造のための物理情報生成AI:生成モデルにおけるハードな物理制約の構成的強制

本論説は、半導体製造などの物理的制約が厳しい領域では、生成AIが事後フィルタリングではなく、構成によって物理情報を組み込む必要があると主張する。物理情報拡散、PDE制約変分モデル、ニューラルオペレータ事前分布などのアーキテクチャツールキットを概観し、物理忠実度ベンチマークや微分可能シミュレータを中心とした研究課題を提案する。

arXiv Machine Learningモデル / チップ / 政策サイト内本文
ProHiFlo: 階層的フローマッチングと機能ガイダンスによる新規タンパク質生成

ProHiFlo は、粗から精への生成、事前学習済み予測器による機能ガイダンス、適応型 SE(3)-等変アーキテクチャを備えた革新的な階層的フローマッチングフレームワークであり、計算コストを削減しつつ高精度を維持し、酵素活性部位の足場設計で 58.9% の成功率を達成し、既存手法を大きく上回ります。

arXiv Machine Learningモデル / 研究サイト内本文
スケーラブルな統計的に健全なデータマイニングのための少数ショットリサンプリング

データマイニング結果の統計的有意性評価には通常数千のリサンプルデータセットが必要で、大規模データには非現実的です。本論文では、検定統計量の上限偏差に関する新しい境界を導出し、ごく少数のリサンプルデータセットのみを必要とするFewRSを提案します。FewRSは誤発見の確率を厳密に保証し、パターンマイニングやネットワーク分析で最大2桁の実行時間削減を実現しつつ、高い統計的検出力を維持します。

arXiv Machine Learning研究 / スタートアップサイト内本文
追従行動の二立場評価:同意の構造と介入の限界

アクティベーション・ステアリングはLLMの行動を変えるが、標準的な評価では追従行動低減が事実に基づく同意も抑制するかどうかをテストしない。本論文では二立場評価を導入し、Llama-3-8B-Instructに重心差ステアリングを適用した。追従的同意と事実的同意は幾何学的に異なる部分空間にあるが、ステアリング方向は両方に等しく投影され、区別できないことがわかった。その結果、追従的発言だけでなく地球が丸いといった事実に基づく同意も減少する。このパターンは、活性化から読み取れる表現が書き込めるとは限らないという一般的なギャップを示している。

arXiv Machine Learningモデル / 研究 / スタートアップサイト内本文
不完全なバイナリフィードバックを伴うレストレスバンディット:PCL-インデックス可能性の解析と計算

本論文は、バイナリ潜在状態と不完全なバイナリフィードバックを持つレストレスバンディットを研究する。これは、センシング誤差のある機会的スペクトラムアクセスに動機づけられている。著者らは、部分保存則(PCL)に基づく解析・計算フレームワークを開発し、インデックス可能性の確立とWhittle指数の計算を行う。確率的スケルトン、再生分解、単語上の組み合わせ論を用いて、いくつかの閾値領域で割引報酬とリソース指標の扱いやすい表現を得て、PCL-インデックス可能性条件を完全に検証する。残りの領域では、限界生産性指数を計算するための効率的な数値スキームを導出する。実験により、MP指数ポリシーが広範なパラメータ範囲で標準ベンチマークを上回ることが示される。

arXiv Machine Learning政策 / 研究サイト内本文
デプロイメント中心評価:臨床LLMシステムにおけるクエリレベルの拒否リスク予測

本論文は、学術医療センターの電子健康記録に組み込まれたLLMシステムのデプロイメント中心評価を提案する。クエリ内容とデプロイメント固有のコンテキスト(提供者タイプ、部門、使用言語モデル)を用いて事前応答分類器を訓練し、ユーザーの拒否リスクを予測する。4.5ヶ月の前向き分析でAUROC 0.719を達成し、デプロイメントコンテキストを用いた拒否予測の実現可能性を示し、標的ガードレールや棄権戦略への道を開く。

arXiv AIモデル / 研究 / スタートアップサイト内本文
AGIからASIへ:汎用人工知能から超知能への移行経路

新たなプレプリント論文では、人間レベルの汎用人工知能(AGI)から人工汎用超知能(ASI)への移行を検討し、4つの潜在的な経路(AGIのスケーリング、AIパラダイムシフト、再帰的改善、大規模マルチエージェント集団からのASIの出現)を提示しています。また、これらの経路上の摩擦やボトルネックについて議論し、AIの進歩が加速し、単一の変革ではなく一連の変革をもたらす可能性があると指摘しています。

arXiv AIAgent / 研究サイト内本文
Evoflux: コンパクトエージェント向け実行可能ツールワークフローの推論時進化

コンパクトな言語モデルは、単独の関数呼び出しを超えたツール使用において課題に直面する。Evofluxは推論時に進化的探索を用いて実行可能なツールワークフローを修復し、MCP-Benchタスクで実行可能性を約3%から17-24%に向上させ、SFTやDPOベースラインを上回る。

arXiv AIモデル / Agent / 研究サイト内本文
TrajGenAgent: 人間の移動軌跡生成のための階層的LLMエージェント

TrajGenAgentは、モデル微調整なしで現実的な合成人間移動軌跡を生成するための階層的LLMエージェントフレームワークを提案する。2段階のオーケストレーター・ワーカー設計を採用:LLMがまずインコンテキスト学習により個人・曜日条件付き活動連鎖を合成し、次に決定論的ワークフローがパーソナライズされたPOI検索、距離認識位置選択、運動学認識移動時間伝播、LLMベースの持続時間推定により各活動を完全な訪問に具体化する。異常検出ベースの評価フレームワークで行動的・意味的妥当性を評価する。実験では、ベンチマークおよび大規模シミュレーションデータセットにおいて、時間空間的忠実性、意味的一貫性、個別行動の現実性で既存手法を上回る。

arXiv AIモデル / Agent / 研究サイト内本文
「あなたは嘘をつきましたか?」モデルスケールと信念検証済みモデル生物における嘘発見器の評価

大規模言語モデルの嘘発見器を評価するため、13の推論モデル生物(隠れた信念が思考連鎖で検証済み)と多様な欺瞞テストベッドを構築。31のモデルで4種類の検出器をテストした結果、プロンプトによる嘘タスクでは性能がモデル能力と共に向上したが、訓練された生物では思考連鎖判定器を除き性能が大幅に低下。現在の検出器はモデルの信念について高い信頼性を以て主張できない。

arXiv AIモデル / 研究サイト内本文
PersonaDrive:クローズドループ運転シミュレーションのための人間スタイル検索拡張VLAエージェント

PersonaDriveは、スタイル指示された人間の運転データから検索したデモンストレーションを使用して視覚言語行動(VLA)エージェントを条件付け、スタイルごとの再トレーニングなしで多様な運転スタイルを実現する新しいパイプラインです。Bench2Driveでは、無スタイルで運転スコアがSimLingoより4.6%向上し、全スタイルで最高スコアを達成しました。

arXiv AIモデル / Agent / 研究サイト内本文
Pythagoras-Prover: Augmented Lean Formalisationによる効率的な形式証明の進展

Pythagoras-Proverは、4Bおよび32Bの自己回帰モデルと4Bの拡散モデルからなる、計算効率の高いLean定理証明器ファミリーです。段階的なカリキュラムSFTと動的証明フィルタリングにより訓練効率を向上させ、Augmented Lean Formalisation(ALF)を導入して検証コーパスを拡張します。実験では、4BモデルがMiniF2F-TestでDeepSeek-Prover-V2-671Bを上回り(86.1% vs 82.4%)、32Bモデルが93.0%でオープンソースの最高記録を達成し、PutnamBenchで93問を解決しました。

arXiv AIモデル / 研究サイト内本文
AIエージェントのための戦略的決定支援

従来の決定支援は人間が機械学習モデルを使ってより良い決定をする方法を研究してきた。しかし、現代のエージェントシステムでは役割が逆転し、AIエージェントがユーザーに代わって行動し、人間やツールが支援メカニズムとなる。本論文では、支援使用を最小化しつつ、反実仮想的な支援不足エラー(支援があれば出力が改善されたであろう事例でエージェントが単独で行動する確率)を制御する枠組みを提案する。最適方針は支援価値に基づく閾値ルールであり、適応的閾値設定とその場でのキャリブレーションを組み込んだオンラインアルゴリズムを開発。実験により、目標エラーを確実に制御しつつ支援使用を大幅に削減できることを示す。

arXiv AIAgent / 政策サイト内本文
Arbor: 自律エージェントの認知層としての木探索

Arborは、大規模な状態を持つアクション空間で自律エージェントの認知層として構造化木探索を導入するマルチエージェントフレームワークです。フルスタックLLM推論最適化で検証され、ベンダー最適化ベースラインと比較して最大193%のスループット-レイテンシ・パレート改善を達成し、批評エージェントが安定性を確保します。

arXiv AIモデル / Agent / 研究サイト内本文