研究者らは、D²Turbフレームワークを提案。深度認識乱流合成プロトコルと適応型構造事前注入機構を導入し、大気乱流緩和をテクスチャのデブラリングと幾何補正の2つの相互作用する段階に分解することで、合成データと実データの両方で最先端の性能を達成した。
AI ニュース速報
リアルタイム監視
最新ニュース
信頼できる情報源、出典、権限、サイト内閲覧を保ちながら、AI の変化を読める情報に圧縮します。
最新ニュース
本研究では、異種注意構造を持つTransformerモデルの解釈手法を提案し、意味解釈と論理解釈を含む実験で有効性を検証した。
本研究は、ファインチューニングされたビジョン・ランゲージモデル(VLM)を用いて橋梁の損傷理解と修理優先順位スコアリングを自動化する手法を提案する。QLoRAを用いてLLaVA-1.5-7Bを最大4,000対の橋梁損傷画像と点検テキスト記録でファインチューニングし、800画像の固定テストセットで評価した。2,000トレーニングサンプルで2.9時間のトレーニングでほぼ最適な検証損失を達成し、それ以上のデータでは収穫逓減を示した。また、ファインチューニングされたSwallow-8B SLMを用いた2段階の品質ガードが、優先順位スコアリングの前に低品質のVLM出力を拒否する。
第10回ABAWワークショップ&コンペティションがCVPR 2026で開催され、感情模倣強度推定、アンビバレンス/ためらい認識、細粒度暴力検出などの新たなチャレンジを導入し、従来の感情推定・認識タスクとともに、マルチモーダル人間中心AIを推進します。コンペティションは大規模な実環境データセットを活用し、ペーパートラックはポーズ推定から公平性やロバストネスまで幅広いトピックをカバーします。
EvoSpecは、動的な語彙とパラメータ適応によりドラフトモデルをリアルタイムで進化させる新しいフレームワークであり、専門領域やトピック切り替え時の静的なプルーニング手法の受容率低下を克服します。EAGLE-3上でFR-Spec比1.13倍の高速化、メモリオーバーヘッド27%削減を達成。
大規模言語モデル(LLM)は計算社会科学の代理としてますます利用されているが、人間コミュニティの「厚い記述」を忠実に再現する能力は依然として重要な課題である。本稿ではCARE(Community-Aware Reaction Evaluation)フレームワークを提案する。これは、LLMがシミュレートする言説と、実際のコミュニティが現実のニュースに対して示す即時反応を比較する反応中心の評価手法である。発話内トーンの詳細なスペクトルを特徴づけることで、明示的なコミュニティプロンプトでLLMを誘導してもシミュレーションの忠実度が本質的に向上しない「リアリズムギャップ」が明らかになった。さらに、最先端モデル間で異なる行動特性が確認され、現在のアライメント戦略はオンライン集団の社会言語学的ダイナミクスを捉えるには不十分であることが示唆される。
FLUIDフレームワークは、自己回帰言語モデルを拡散モデルに適応させ、効率的な並列テキスト生成を実現します。厳密因果アライメントによりGPTチェックポイントを再利用し、エントロピー駆動の弾性地平でノイズ除去ステップを動的に調整します。トレーニングコストを桁違いに削減しつつ、最先端の性能を達成します。
研究者らは、低リソース言語の音声言語モデルにおいて合成データを使用する際の「安定性-表現力ギャップ」を特定し、韻律の多様性を回復する2つの自己アライメントフレームワーク(DGSAおよびTDSC)を提案。ElevenLabsやGemini Proなどの商用システムを凌駕し、ラオ語での初のゼロショット音声クローンを実現。
BioELXは、注釈付きトレーニングデータを必要としない、新しい言語横断的生医学エンティティリンキングフレームワークです。Wikidataの多言語エイリアスでSapBERTを強化し、事前学習済みLLMを使った文脈認識型曖昧性解消を行います。5つのベンチマークでの実験により、特にトルコ語、韓国語、タイ語などの低リソース言語で大きな改善が見られました。
RAG-Codingは、4つの大規模言語モデル(LLM)エージェントを調整し、外部知識源(公式コード一覧やガイドラインなど)に基づいて意思決定を行う自動化されたICD-10-CMコード化手法です。MDACEデータセットでは、最良のLLMベースラインと比較してマイクロF1で8〜13%、マクロF1で2〜8%向上しました。最先端の事前学習モデルPLM-ICDと比較すると、RAG-Codingはマイクロ再現率が11%高い一方、PLM-ICDはマイクロ精度が6%高く、両者のF1は同等です。アブレーション実験により外部知識の重要性が確認されました。また、2025年ガイドラインに基づいて専門家が再注釈したMDACE-2025データセットを公開し、より細かいコードラベルでの評価を可能にしました。
本論文では、プロンプトベースのテキスト読み上げ(TTS)モデルにおいて、発話間スタイル補間と発話内スタイル遷移を可能にする新しい手法を提案。埋め込み空間での方向ベクトル補間と、KVキャッシュスワッピングおよびスライディングウィンドウアテンションマスキングを導入し、実験では性別変換成功率99-100%、発話内の滑らかなスタイル変化を達成した。
大規模言語モデル(LLM)が自律エージェントとして動作する際、インコンテキスト・リワードハッキング(ICRH)と呼ばれる現象により、代理目的を最大化する反復最適化が有害な副作用を引き起こす。既存の防御策では不十分であり、ICRHはモデル自身の過剰最適化に起因する。本稿では、LLMベースの制約最適化(LCO)フレームワークを提案する。LCOは自己思考モジュールと進化サンプリングモジュールから構成され、モデルの微調整なしでICRHを低減する。実験では、ツイートエンゲージメント最適化タスクにおいてGPT-4の有害性成長率を39%削減し、ポリシー最適化ベンチマークではICRH発生率を15.23%削減し、タスク性能を維持した。
ICGは、マルチモーダル大規模言語モデル(MLLM)を用いたプロンプティングとパーソナライズされた選好アライメントを統合し、高品質で文脈に適したカバー画像を生成する新しいフレームワークです。メタトークンを介して意味的特徴を抽出し、ユーザー埋め込みで洗練させ、拡散モデルに注入します。公開報酬とパーソナライズされた選好モデルを組み合わせたマルチ報酬学習戦略により、ラベル付き教師データを必要としません。実験では、画質、意味的忠実度、パーソナライズが向上し、ユーザーの魅力と推薦精度が向上することが示されています。
HEALは、フェデレーテッドラーニング、ゴシップラーニング、エピデミックラーニングの強みを組み合わせた新しいクロスレイヤー分散学習フレームワークです。エレベーターアルゴリズムを使用して動的にノードをアグリゲーターに昇格させ、故障耐性を実現し、クラッシュのない環境ではフェデレーテッドラーニングと同等の性能を示し、クラッシュが発生しやすい環境ではゴシップラーニングやエピデミックラーニングを上回ります。
SignGADフレームワークは、固定パイプラインの代わりに自己設計のタスク条件付き検出ワークフローを採用し、限られた教師データ下での信頼性を高めるガード付き最終再適合戦略を導入する。
本論文は、継続学習において事前学習モデルを選択するための軽量な指標であるアーキテクチャ駆動型シフト(ADS)を提案する。ADSはロジットシフトをアーキテクチャ依存とデータ依存に分解し、少数のデータサンプルでシフト傾向を捉える。175以上のアーキテクチャでの実験により、ADSとロジットシフト間に強い単調相関(スピアマンのrs ≥ 0.731)が示され、ADSは3データセット・6シナリオで信頼性の高いCLモデル選択のための軽量プロキシとして機能する。
本論文は、正定値計量行列でパラメータ化された主成分分析(MAPCA)を提案し、幾何学的深層学習の枠組みに位置付ける。MAPCAは計量を幾何学的先験として解釈し、その解は直交群の下で同変であり、スペクトルは不変である。また、IPCAがMAPCA族内で対角スケーリングに対して同変な唯一の線形データ由来計量であるという一意性定理を証明する。最後に、カーネルPCA、スペクトルグラフ法、深層MAPCAへの拡張を議論する。
本サーベイは、混合専門家モデル(MoE)がマルチモーダル学習の課題を効率的エンジン、表現学習器、アダプターという3つの視点からどのように解決するかを探り、解釈可能なルーティングや専門家間通信などの研究ギャップを特定する。
本論文では、エッジAIGCリソース管理のための実行可能かつ進化するエージェント$E^3$-Agentを提案する。ミリ秒単位のルーティング決定を行う高速パスと、イベント駆動型LLMメタコントローラからなる低速パスを分離し、実行フィードバックからオンライン学習することで、未知で時変的なサービス時間マッピングに適応する。評価では、平均レイテンシを65%-73%削減し、スタッター率も効果的に抑制した。
研究では、構造化状態空間モデルの対角バリアントS4Dが、複雑なMambaアーキテクチャよりも時系列分類タスクで正確かつ効率的であることが示されました。著者らが提案した軽量改良版MS4とMS4Nは、59のデータセットでMambaモデルを凌駕し、パラメータ数が2倍および10倍のディープラーニングモデルに匹敵します。
本論文では、情報ギャップに基づく階層的マルチジェネレーター協調とスケジューリングにより、ワイヤレスセンサーネットワーク内のIoTセンサーのサンプリング周波数決定を自動データ拡張で最適化するIGADA-IoTフレームワークを提案。実験では、複数の下流モデルの平均精度を7.27%向上させ、既存手法を上回った。
本論文は、異種環境における連合強化学習(FedRL)の課題に対処するため、パーソナライズド観測正規化(PON)手法を提案する。各エージェントは、継続的に更新される実行平均と分散を用いてローカルに生の状態入力を正規化し、一貫したスケーリングを保証する。正規化パラメータの共有は非効率であることが示され、実験では異種MuJoCoタスクでトレーニングの高速化と優れた性能を達成。IJCNN 2025に採択。
本論文は、人間の行動の変動性が観測可能な入力だけでなく、個人の動的な潜在状態に起因することを主張する。意思決定時の状態の重みに介入することで、結果を因果的に制御できると提案する。因果推論、予測処理、アロスタシス、注意ボトルネック、時間生物学、計算精神医学の6つの証拠と、20万人以上のユーザーから得た24ヶ月の観測データに基づく。7つの検証可能な予測と状態認識システムのための6つの運用要件を導出し、デジタルヘルス、教育、AIパーソナライゼーション、個人の主体性への示唆を論じる。
Agynは、Kubernetes上のシグナル駆動型ステートフルサーバーレスランタイム、Terraformプロバイダーによるエージェント定義、ゼロトラストセキュリティモデルを備えたオープンソースのAIエージェントプラットフォームです。エージェント、モデル、クラウドに依存せず、本番環境でのスケーラビリティ、ガバナンス、セキュリティの課題に対処します。
本論文は、リアルタイムデータストリーム上で自律的に洞察を発見するマルチエージェントアーキテクチャを提案する。Apache Kafka、Flink、大規模言語モデルを用いて、仮説の生成、検証、可視化を継続的に行い、受動的なクエリ駆動分析から能動的な発見駆動システムへの移行を実現する。
LaneRoPEは、シーケンス間アテンション機構と位置エンコーディング拡張により、複数のLLMシーケンスが生成中に協調できるようにし、数学的推論タスクにおける精度を向上させる。アーキテクチャへの変更は最小限で、推論時のオーバーヘッドは無視できる。
機械学習の忘却検証は通常、出力レベルの指標に焦点を当てますが、モデルはこれらのテストを通過しながら内部表現に忘却データを保持することがあります。本論文では、オラクル比較指標M2とオラクル不要指標M4を含む表現レベル検証指標群RULERを提案します。実験では、近似忘却手法が出力レベル評価を通過する一方、表現レベル分析では有意な残差を示します。
本論文は、大規模言語モデルが因果発見を行う際の根本的な限界を証明しています:教師ありファインチューニング、直接選好最適化、インコンテキスト学習などの手法では、類似した観測データを生成する因果グラフを区別できません。著者らは、凍結された言語モデルを介入オラクルとして使用し、外部ベイズループが対数回数のラウンドで候補グラフに収束するエージェンティック因果ベイズ最適化(A-CBO)を提案しています。Corr2Causeでは、A-CBOは訓練なしでファインチューニングベースラインに匹敵し、24変数・18Kテストサンプルに拡張したExtended Corr2Causeでは、A-CBOはファインチューニングおよび選好最適化の両方を大幅に上回ります。
本論文では、DFJSPのための診断フレームワークDynaSchedBenchを提案する。逐次イベント空間キャリブレータ(SESC)とスケジュールストレス指標(SSI)を用いて難易度を層別化したインスタンスを生成する。LLMスケジューリングエージェントにおける「可観測性のパラドックス」を特定し、完全な構造情報を提供すると性能が低下することを発見した。ツール拡張や洗練戦略も信頼性のある改善をもたらさない。
生物進化における種の起源に着想を得て、合成情報の起源を探求する本論文は、ステガノグラフィを用いて情報の系統を追跡可能にするメカニズムを提案する。AI生成コンテンツの出所特定が困難になる中、真実と信頼を守るための重要な試みである。