AI News HubLIVE

AI ニュース速報

リアルタイム監視

今日の AI で最も重要な変化

105 件の信頼できるソースから抽出。最終更新 2026-06-01 13:00 UTC+9。

リアルタイム監視

最新ニュース

信頼できる情報源、出典、権限、サイト内閲覧を保ちながら、AI の変化を読める情報に圧縮します。

最新ニュース

リセット
構造化された相互作用がモデルスケーリングを超えて分散協調を向上させる:実世界マルチロボットシステムにおける検証

本研究は、10台の実機ロボットを用いた運搬とマッピングタスクにおいて、完全結合からモジュール型階層的相互作用への通信トポロジ変更により正規化性能が47ポイント向上したのに対し、ニューラルネットワークの隠れ層サイズを2倍にしても最大9ポイントの向上にとどまることを示した。ネストされた混合効果モデルの比較により、トポロジの効果がモデルサイズよりもはるかに大きいことが確認された。性能は隠れユニット数1024を超えると飽和するが、これはシミュレーションキャリブレーションによる外挿であり、直接ハードウェア上での観測ではない。結果は、試験されたシステムとタスク設定において相互作用構造が支配的な役割を果たす可能性を示唆するが、より広範な定量的一般化は今後の課題である。

arXiv Roboticsモデル / 研究 / ロボットサイト内本文
GDPR準拠の視覚監視のためのオンデバイス生成AI:ローカル物体検出からの自然言語アラート

本論文は、すべての推論をエッジデバイス内に閉じ込めるプライバシーバイデザインの視覚監視パイプラインを提案する。Raspberry Pi 5上のHailo-8LアクセラレータでYOLOv5n-segモデルを使用し、推論直後に生のピクセルバッファを破棄する。ステートフルトリガーエンジンは最小限のJSONイベントペイロードをローカルで動作するPhi-3 Mini LLMに送信し、自然言語アラートを生成する。画像データは決してデバイス外に出ず、GDPR準拠を実現する。

arXiv Computer Visionモデル / チップ / 政策サイト内本文
磁気共鳴画像を用いた脳腫瘍セグメンテーションのための新しいグローバルコンテキスト認識深層ニューラルネットワーク

研究者らは、マルチモーダルMRIから脳腫瘍を正確にセグメンテーションするためのGCSER-UNetという新しい深層学習ネットワークを提案した。このネットワークは空間的・チャネル的注意機構を融合し、TCGA LGGデータセットで94%、BraTS 2020データセットで95%/92%/90%のDiceスコアを達成し、従来の最先端手法を上回った。

arXiv Computer Visionモデル / 研究 / スタートアップサイト内本文
クラスタリングガイドによるドメイン特化型事前学習ファンデーションモデル:超高解像度北極リモートセンシング

本研究は、多様性を考慮した画像キュレーションとマスクオートエンコーダ(MAE)自己教師あり事前学習を組み合わせた北極向けリモートセンシング基礎モデルを提案する。4つの北極データセットでImageNetベースラインより5-8%のF1改善を達成し、汎用地球観測モデルPrithvi-EO-2.0を少なくとも15%上回り、ドメイン特化事前学習の重要性を示した。

arXiv Computer Visionモデル / Agent / チップサイト内本文
Dex2HOI:巧みな両手による二物体インタラクション生成

Dex2HOIは、テキストから単一物体および二物体の人間-物体インタラクション(HOI)を生成する統一拡散モデルです。双方向クロスアテンションを用いたデュアルストリーム拡散アプローチ、手相対物体表現を組み込んだモーション融合ネットワーク、およびリアルタイム生成を可能にする自己回帰サンプリングを採用し、従来手法と比較して最大540倍の推論速度向上を達成しています。

arXiv Computer Visionモデル / 研究 / スタートアップサイト内本文
構造的リファインメントによるGenAI画像編集のコンテンツシフトと幻覚の軽減

本論文は、入力画像とGenAI拡張画像を融合する後処理フレームワークを提案し、知覚的向上を維持しつつ構造的忠実性を強制することで、空間的ずれ、テクスチャ歪み、コンテンツ幻覚を効果的に抑制する。実験では、画素レベルの構造的一貫性と入力解像度を保ちながら、美的品質をよりよく保持することが示された。

arXiv Computer VisionAgent / 研究サイト内本文
DTG-Restore:学習不要の拡散モデルによる生成ビデオ超解像リファインメント

本論文では、学習不要でビデオ拡散モデルの事前知識を活用し、歪んだ低解像度ビデオを高品質化するフレームワークDTG-Restoreを提案する。提案手法は、解きほぐし時間ガイダンス(DTG)を用いて条件付きブランチと無条件ブランチの結合を時間的に分離し、よりクリーンな拡散タイムステップで無条件ブランチを評価することで、形状を保持しながら歪みの複製を抑制する。この時間バイアスをサンプリング中にアニールすることで、再学習なしで構造補正から詳細洗練へ移行する。既存の復元モジュールとプラグアンドプレイで組み合わせ可能であり、AI生成ビデオと実世界ビデオの両方で知覚的一貫性と妥当な構造を回復する。評価用に、多様なテキスト・ツー・ビデオモデルから合成された4,400本の歪んだ480pビデオからなるベンチマークGenWarp480を構築。実験により、モデル学習なしで構造忠実度と時間安定性の大幅な向上を実証した。

arXiv Computer Visionモデル / 研究 / スタートアップサイト内本文
SANA-Streaming: ハイブリッド拡散トランスフォーマーによるリアルタイムストリーミングビデオ編集

SANA-Streamingは、コンシューマGPU上で高解像度リアルタイムストリーミングビデオ編集を実現するシステム・アルゴリズム共同設計フレームワークです。ハイブリッド拡散トランスフォーマー、サイクルリバース正則化、効率的なシステム共同設計を採用し、RTX 5090で1280x704解像度24 FPSのリアルタイム編集を達成。実験では時間的一貫性とスループットで既存手法を大幅に上回ります。

arXiv Computer Visionモデル / チップ / 研究サイト内本文
軽量SAR船舶検出のためのコントラスティブ蒸留

本論文では、共有投影埋め込み空間でコントラスティブInfoNCE損失を用いて教師検出器から関係幾何学を転移する知識蒸留フレームワークSURGEを提案。SSDDおよびHRSIDベンチマークで2段階検出器に最大6.2 mAP、8.0 AP75の向上をもたらし、教師性能を超える。

arXiv Computer Visionモデル / 研究サイト内本文
CanLegalRAGBench: カナダ判例法における検索拡張生成の評価

本稿では、現実的な法的クエリと専門家による注釈付き回答に基づくカナダ法のQAベンチマーク「CanLegalRAGBench」を紹介する。評価の結果、検索性能は設計選択に敏感であり、オープンソースの埋め込みモデルはクローズドソースモデルと競合するが、自動評価には限界があり、生成された回答は幻覚や過剰な詳細を含むことが多い。このベンチマークは法的RAGシステムの改善を促進することを目的とする。

arXiv Computational Linguisticsモデル / 政策 / 研究サイト内本文
英語が地域知識を書き換えるとき:大規模言語モデルにおけるグローバルな物語の支配

本研究は、LLMが文化的に根付いた質問に対して局所的文脈よりもグローバルな物語を優先する「グローバルな物語支配」という現象を、バングラ語の低リソース文化を例に調査した。CulturalNBデータセットを用いた実験で、英語での質問はグローバルな代替と制度的枠組みを増やし、局所的視点を減少させること、また局所的証拠は事実整合性を改善するが言語起因の認識的シフトを排除できないことを示した。この発見は、文化的失敗が単なる知識欠落ではなく、接地と物語の優先順位付けの問題であることを示唆している。

arXiv Computational Linguisticsモデル / 研究サイト内本文
マルチモーダル音声モデルは顔で判断する? – 認識精度に偏見を発見

マルチモーダル音声認識におけるバイアスを初めて系統的に評価した研究。同じ音声に異なる顔を組み合わせると、性別や民族の交差において単語誤り率が最大4.05ポイント変動することが判明。モダリティ追加が新たな偏見を生む可能性を警告。

arXiv Computational Linguisticsモデル / 研究 / スタートアップサイト内本文
知識グラフ強化型ゼロショットトピック分類:複数戦略の比較研究

本研究では、記事ごとの知識グラフで強化されたゼロショットマルチラベルトピック分類フレームワークを提案し、15の大規模言語モデルと8つのデータセットで8つの手法を体系的に評価。キーワード強化分類(AK)が基本手法で最良。グラフ強化は小規模モデルには有効だが大規模モデルには逆効果で、大規模モデルは事前学習から十分な関係情報を獲得していることを示唆。自己無撞着デコーディングは性能向上なしで計算コストを約5倍に増加。

arXiv Computational Linguisticsモデル / 研究サイト内本文
比喩表現生成のための言語横断的ステアリング

多言語大規模言語モデルにおける比喩表現生成の内部信号が言語固有か複数言語間で再利用可能かを調査。活性化ステアリングを用いて、ある言語での比喩-文字通りの活性化差から方向を推定し、生成時に適用。5つの比喩カテゴリ、6言語、4つの多言語LLMで実験し、同じ言語内では特にメタファーと直喩で信頼性高くステアリング可能。さらに、言語間で方向が転移し、ドイツ語が最も受容的。複数言語から組み合わせた方向はターゲット言語自身の方向に匹敵または凌駕し、共有成分を除去すると弱まる。

arXiv Computational Linguisticsモデル / 研究サイト内本文
言語モデルにおけるドメイン適応と推論フレームワーク:歴史宇宙論を用いた統制実験

新しい研究では、歴史宇宙論を統制実験として用い、ドメイン適応が言語モデルの説明行動をどのように再形成するかを調査しました。フェーズ1では、地動説の参照を除去したコペルニクス以前のコーパスで小規模モデルをゼロから訓練。フェーズ2では、QLoRAを用いて大規模な事前学習モデルを微調整。その結果、ドメイン適応は主に説明フレームワーク(前近代対近代)をシフトさせ、宇宙論的立場を直接変更するわけではないことが示されました。立場の変化はフレームワークシフトの副産物であることが示唆されました。

arXiv Computational Linguisticsモデル / 研究サイト内本文
モデル専門化のための自律エージェントデータエンジニアリングの探求

大規模言語モデル(LLM)は汎用タスクでは優れた性能を示すが、専門領域への適応には高品質なドメイン固有データが必要。本論文では、LLMが自律的にデータエンジニアとして機能し、エンドツーエンドのデータキュレーションを通じてモデル専門化を推進する「自律エージェントデータエンジニアリング」を提案。GPT-5.2はエージェント駆動のデータ適応により、学生モデルの性能を57.29%向上させた。

arXiv Computational Linguisticsモデル / Agent / 研究サイト内本文
RAG対応・クロスモデル多数決ワークフローを用いたChatGPTの生物医学的関連生成と検証の評価プロトコル

本稿では、ChatGPTが疾患中心の生物医学的関連を生成する能力を評価するプロトコルを提案する。関連の生成、生物医学オントロジーを用いた生物学的エンティティの検証、文献による関連の確認方法を概説する。プロトコルは、ChatGPTモデル間での生成信頼性を評価する自己一貫性戦略を含む。オントロジーの完全一致制限に対処するため、オープンソース大規模言語モデル(LLM)を活用した検索拡張生成(RAG)によるセマンティック検証ワークフローを提供する。これにより、他のLLMが生成したコンテンツに対する真実性を確立し、ハルシネーションを露呈できる。

arXiv Computational Linguisticsモデル / Agent / 研究サイト内本文
キャリブレーションされた選好学習:ラベルランキングのケース

本論文は確率的ラベルランキングにおけるキャリブレーションを形式化し、全ランキング、サブランキング、トップkランキングをカバーする階層を開発する。全ランクキャリブレーションは他を含意するが逆は成り立たないことを証明。実験では、一般的なラベルランキングモデルのキャリブレーションが不十分であること、およびキャリブレーションがトップ1精度を超えてRLHF報酬モデルの精度と強く相関することを示す。

arXiv Machine Learning研究サイト内本文
LongDS-Bench:長期エージェントデータ分析の失敗に関する研究

既存のベンチマークは孤立した短期間の対話タスクを評価するものが多く、エージェントが長期間にわたって分析コンテキストを追跡する能力をテストしていない。研究者らはLongDSベンチマークを導入。68のタスクは実際のKaggleノートブックから構築され、6つのドメインにわたる2225ターンを含む。評価の結果、最良モデルの平均精度は48.45%で、初期から後期にかけて47ポイント低下し、長期エラーが失敗の52%~69%を占めた。追加ステップは必ずしも性能向上につながらず、鍵は分析状態の維持にある。

arXiv Machine LearningAgent / 研究サイト内本文
NumLeak: 公開数値ベンチマークを基礎モデルの潜在ラベルとして利用

本稿では、基礎モデルが公開数値ベンチマークを記憶していることを検出するフレームワークNumLeakを提案する。トップLLMは訓練データから正確な数値を高精度に再現し、誤った精度感覚を生み出す。実験では金融・経済データで最大0.99の相関を示すが、新しいデータでは性能が急落する。ホワイトボックスlogprob分析はオープンエンド生成よりも記憶を検出でき、単純なシステムプロンプト防御がほとんどの攻撃を防ぐ。

arXiv Machine Learningモデル / 研究 / スタートアップサイト内本文
AISデータに基づく海上異常検知のための教師なし学習の新評価指標:MADQI

本論文は、ラベルなしデータで教師なし異常検知モデルを評価するための新しい複合指標であるMADQI(海上異常検知品質指数)を提案する。ARC、PPS、SDS、ECEの4つの指標を統合し、マルチチャンク評価と適応スケーリングで自動正規化する。AISデータセットでの実験でMADQIスコア80.37%を達成し、特にECEとARCが0.907と1.000と優れた性能を示した。

arXiv Machine Learning研究 / スタートアップサイト内本文
ウェーブレット画像変換とスペクトルフローマッチングによる機能MRI時系列生成と脳障害識別

Dual-Spectral Flow Matching(DSFM)という新しいfMRI生成フレームワークを提案。離散ウェーブレット変換と離散コサイン変換をカスケードし、BOLD信号の非定常性やマルチスケール変動を捉え、スペクトルフローマッチングでクラス条件付きコサイン周波数表現を生成、逆変換で生理学的に妥当な時系列を再構成。脳ネットワーク分類性能を向上。ICLR 2026採択、コード公開。

arXiv Machine Learningモデル / 研究サイト内本文
ディープニューラルネットワーク不要のLLM:新しいアーキテクチャ、利点、ケーススタディ

本論文は、ディープニューラルネットワークを必要としない新しい大規模言語モデル(LLM)アーキテクチャを紹介する。RBFネットワークに基づき、損失関数の大域的最適解を閉形式で一回の反復で見つけ、説明可能性と精度を向上させる。

arXiv Machine Learningモデル / 研究サイト内本文
LLMが一貫して誤ることを学ぶとき:合成欺瞞の線形表現に関するマルチモデル研究

本研究は、5つのTransformerモデルをLoRAで微調整するマルチモデルパラダイムを導入し、合成欺瞞を調査した。線形プローブは初期層でほぼ完全なAUCで欺瞞を検出し、ロジスティック回帰プローブはMLPプローブを上回り、線形表現仮説を支持する。プローブはドメイン間でほぼ損失なく汎化する。モデルによって表現機構が異なり、Pythia/Llama/Qwenでは表現崩壊、Gemma-2では高次元保存が見られる。これらの結果は、適度な教師あり微調整によってロバストでドメイン不変な欺瞞表現が迅速に定着することを示しており、活性化ベースのモニタリングに示唆を与える。

arXiv Machine Learningモデル / 政策 / 研究サイト内本文
Unicorn:普遍相関モデリングによる高次元時系列予測のスケーリング

Unicornフレームワークは、潜在プロトタイプコードブックを用いてチャネル相関と特定のアイデンティティを分離し、異種データセットにわたるスケーラブルな事前学習を実現し、少数ショット転送シナリオで既存手法を大幅に上回る。

arXiv Machine Learningモデル / 研究サイト内本文
Gait2Hip-60:マルチケイデンス歩行運動学から股関節筋力と関節モーメントを予測する統一深層学習ベンチマーク

研究チームは、歩行運動学から股関節筋力と関節モーメントを直接予測する深層学習フレームワークを開発し、LSTM、Transformer、Mambaの3モデルを比較。Transformerが60名の健常者で最高性能を示し、大腿骨頭壊死患者へのゼロショットテストでも中程度の予測能力を維持した。臨床応用にはさらなる検証が必要。

arXiv Machine Learningモデル / 研究サイト内本文
QASM-Eval:OpenQASM-3のハードウェア指向プログラミングのためのLLM訓練・評価データセット

量子コンピューティングはNISQ時代にあり、ノイズの制約を受ける。これを克服するには、回路中間測定、量子誤り訂正のための古典フィードバック、動的デカップリングのための精密タイミング制御、校正のためのパルスレベル波形アクセスといったハードウェア指向の機能が必要であり、OpenQASM-3はこれらを提供する。しかし、LLM向けにOpenQASM-3の高度なハードウェア機能を扱うデータセットは存在しなかった。そこでQASM-Evalが開発された。これは初の包括的データセットで、専門家検証済みの100タスクのテストセットと4000タスクの訓練セットからなり、古典論理、タイミングスケジューリング、パルス制御、複雑な実世界ワークフローをカバーする。拡張検証器により構文、量子状態、プログラムタイムラインを自動チェック。評価の結果、最先端のLLMでもOpenQASM-3のコーディングは困難だが、QASM-Evalでファインチューニングすることで大幅な性能向上が見られた。このデータセットはNISQ時代のハードウェア向け量子プログラミングにおける信頼性の高いLLMアシスタント開発の基盤となる。

arXiv Machine Learningモデル / Agent / 研究サイト内本文
MAVEN:エージェントツール呼び出しにおける汎化の向上

MAVEN(モジュラーエージェント検証・実行ネットワーク)は、構造化分解、適応型ツールオーケストレーション、中間検証を通じて、ツール呼び出し環境における汎化を強化する軽量な記号的推論フレームワークです。MAVEN-Benchストレステストでは、MAVENはGPT-OSS-120bベースモデルの精度を追加トレーニングなしで48%から71%に向上させ、オープンウェイトバックボーンを使用してプロプライエタリベースラインの約10分の1のコストで競争力を維持します。

arXiv AIモデル / Agent / 研究サイト内本文
戦略的提供者応答下でのポリシーアズコード探索による医療メカニズム

既存の医療AIベンチマークは提供者の応答を固定しており、メカニズムが生み出す均衡を評価できない。本研究は、病院のメカニズム設計を言語モデル向けプログラム合成として再定義し、マルチエージェントシミュレーターMedi-SimとLLM誘導進化的コード探索を用いて、アップコーディングを排除し拒否を半減しつつベースラインの資金を維持する解釈可能な混合目的プログラムを合成した。

arXiv AIモデル / Agent / 政策サイト内本文
リルーティング・レビン木探索のための構造誘導情報

本論文では、明示的なサブゴール生成のオーバーヘッドを回避するために、√LTSアルゴリズムを用いた学習型リルーターを提案し、クラスタリングベース、ヒューリスティックベース、ハイブリッドの3つの設計を実証。複雑な環境でもスケーラブルであり、最先端のオンライントレーニング効率を達成。

arXiv AIAgent / 政策 / 研究サイト内本文