新しい研究により、最先端の視覚言語モデル(VLM)は空間推論タスクにおいて視点を跨いで一貫した予測をするものの、それが誤っていることが多く、視覚的証拠ではなく事前知識に依存していることが明らかになった。研究者らはこの問題を診断するためのマルチビュー評価プロトコルViewDiagを提案する。
AI ニュース速報
リアルタイム監視
最新ニュース
信頼できる情報源、出典、権限、サイト内閲覧を保ちながら、AI の変化を読める情報に圧縮します。
最新ニュース
AVTrackは、カメラの動き、視覚的遮蔽、位置変化などの挑戦的な条件を含む、動的な実世界シナリオ向けに設計された人間中心の音声・視覚インスタンスセグメンテーションデータセットです。既存手法の性能が大幅に低下することが評価で示され、複雑環境でのロバストなシーン理解のためのベンチマークを提供します。
本論文では、COD10Kに基づくロバスト性ベンチマークCOD10K-Cを提案する。8種類の劣化タイプと5段階の深刻度を含み、合計40条件、81,040の評価ペアを提供する。SINet-v2、PFNet、ZoomNet、および軽量モデルRobustCODLiteを評価した結果、すべてのモデルが劣化画像で性能低下を示し、特にモーションブラーとガウシアンブラーの影響が大きい。RobustCODLiteは劣化拡張、周波数事前分岐、不確実性一貫性損失を用いて、劣化下でもクリーンDiceスコアの92.3%を維持し、他のモデルを上回る。ベンチマークとコードは公開予定。
Qwen3-14Bの隠れ状態をプロービングした研究により、リニアプローブが推論タイプ(演繹、帰納、アブダクション)を100%の精度で分類できるように見えても、実際にはタスク形式の交絡因子(ソース、選択肢数、応答長)を検出していることが示された。交絡を除去すると精度は偶然レベルに低下し、因果操作実験でも機能的な関連は見られなかった。この発見は、メカニスティック・解釈可能性において日常的なタスク形式の交絡除去を促す。
大規模言語モデルエージェントが各決定ステップで冗長なテキスト推論を生成する非効率性に対処するため、研究者は適応的潜在エージェント推論(ALAR)を提案する。これは、ルーチン的なターンではコンパクトな潜在推論を使用し、より深い検討が必要な場合にのみ明示的な連鎖思考に切り替えるデュアルモードフレームワークである。実験では、検索タスクで最大43.6%、ツール使用で84.6%のトークン削減を達成し、タスク精度を維持した。
ハイエクの市場理論に触発された研究者らは、オークション、支払い、富の蓄積を通じてエージェントが競争する経済システムを提案。中央集権的な制御なしに集団知能が創発し、数学的推論や金融研究などの5つのタスクで従来の単一モデルを上回る性能を示した。
自然言語から一階述語論理(NL-to-FOL)への正確な変換はニューロシンボリックAIと自然言語推論(NLI)の基盤ですが、ベンチマークデータセットFOLIOとMALLSは厳密に監査されていませんでした。本研究では、これらのデータセットを体系的に調査し、約39%(FOLIO)と36%(MALLS)のエントリに誤ったFOL形式化があることを発見しました。修正された正解ラベルを公開し、LLMベースのフレームワークを提案することで、人間によるレビュー作業を70%以上削減し、24%未満のインスタンスのレビューで90%のデータセット精度を達成できることを示しました。
研究者らは、13~17世紀のテルグ語古典詩を現代のテルグ語および英語の散文に翻訳するためのデータセット「Padyam2Gadyam」を発表した。600の詩と人間による検証済み翻訳で構成される。5つの大規模言語モデルを評価した結果、両言語で改善の余地が大きいことが示された。
法律、医療、金融などの高リスクシナリオでは、たった1回の会話履歴でもLLMの出力に差が生じることが研究で示された。LLMはユーザーの社会人口統計情報を推測するのに苦労するが、会話トピックが代理として機能し、予測不可能な形でアドバイスに影響を与える。
本研究は、大規模言語モデルの表現における語彙的重複の影響を調査し、語彙効果が全ての層にわたって持続し、アーキテクチャや訓練方法に関わらず一貫していることを発見した。中間層では語彙と意味の信号が同時に劣化する領域が存在し、要約やモデル編集などの下流タスクにも影響を及ぼす。
31の大規模言語モデルの環境態度を評価した研究により、多くのモデルが平均的な人間よりも環境に進歩的である一方、文脈依存性やお世辞行動が明らかになった。
IdiomXは、19万以上の文脈化された例を含む大規模多言語慣用句ベンチマークであり、12,000以上の慣用句を英語、アラビア語、フランス語でカバーします。4つのタスク(慣用句検出、文脈から慣用句への検索、アラビア語から英語への慣用句検索、慣用句解釈)を定義し、実験ではTransformerモデルが検出を改善し、ハイブリッド検索アーキテクチャが性能を向上させることが示されました。
本論文では、テーブル拡散モデルに列値の差から計算したペアごとの角度と長さを入力および補助ターゲットとして追加するGeometry-Aware Tabular Diffusion(GATD)を提案する。MLP実装は平均3.5倍(分類タスクでは最大25倍)少ないパラメータで最先端のベンチマーク性能を達成し、10データセット中8/10のShape、7/10のTrend、9/10の下流ユーティリティ(F1/RMSE)で勝利し、Shapeエラーを27%、Trendエラーを20%削減した。デフォルトの損失重みはGNNおよびTransformerデノイザーに転送可能であり、27/30のアーキテクチャ・データセットセルでShape、25/30でTrendを改善した。マッチドアブレーションは、追加入力や容量ではなく監視が利得を生むことを示している。これは、明示的な関係監視がテーブル拡散のポータブルな帰納的バイアスであることを示している。
大規模言語モデル(LLM)が継続的に進化するサービスとして展開される中、ベースモデルの頻繁な更新により、以前にデプロイされたタスク固有のLoRAアダプタが無効になる問題が生じています。ReLoRAフレームワークは、知識再利用による再適応を効率的に行い、サービスの準備が整ったLoRAアダプタを迅速に復元し、タスク性能を維持または向上させます。このフレームワークは、ベイズ最適化を用いた適応的LoRA初期化と、スケジュール正則化付き微調整の2つの主要ステップから構成されます。実験では、ReLoRAは準備時間を最大8.9倍短縮し、精度を最大4.6%向上させることが示されています。
StenCEフレームワークを提案。心電図(ECG)と冠動脈造影の特徴を対照学習により統合し、ECGから重症冠動脈狭窄の信号を検出する。非侵襲的な早期スクリーニングを可能にし、複数のECGエンコーダで既存手法を上回る性能を達成。初めて高精度な重症狭窄分類を実現。
本論文は、ESGデータの断片化と監査可能性の欠如に対処するため、単一真実源オーケストレーション、時間的異常検出、不均衡認識アンサンブル学習、説明可能性指向ガバナンスを統合した確定的気候リスクインテリジェンスフレームワークを提案する。GHGプロトコル、PCAF、ISSB基準に合わせた合成ベンチマークを公開。分類指標、キャリブレーション指標、新たな監査トレース完全性指標を用いて複数のベースラインと比較評価し、統計的有意性を示す。
論文は、全スライド画像の生存分析におけるTransformerの計算ボトルネックとMambaの入力順序感度を解決するため、TopoMamSurvフレームワークを提案。トポロジー認識順序付けと双方向Mambaモジュール、グラフ畳み込みネットワークを統合し、長期依存関係モデリングと空間構造利用を効率的に実現。5つのTCGAデータセットで性能優位性を確認。
研究により、データセット内のクラス分割評価において、保留された異常クラスが表現空間で正常な混合と重なる場合、異常スコアがランダムになったり反転したりする可能性があり、最適なスコア方向が未知の異常クラスに依存することが示された。訓練不要の診断手法「近傍クラスリーク」を導入し、複数のデータセットと潜在空間でスコア方向の不安定性を予測できることを実証。クラス分割ベンチマークは幾何学的依存のストレステストとして扱うべきだと結論付けている。
研究者らは、EEGベースの脳コンピューターインターフェースを敵対的攻撃から守るための軽量CNNを提案し、既存モデルよりも高いロバスト性を示した。
本論文は、ニューラルネットワークの損失景観における曲率指数αが層タイプ間で異なる理由(畳み込み層で約2、Transformer注意層で約1、MLP上昇射影層で1未満)を説明するスペクトルアラインメント分解を提案する。この分解は、αの変動をKronecker因子固有基底と勾配特異方向の間の幾何学的アラインメントに帰着させる。さらに、スペクトル伝達恒等式s=αγを導出し、独立にフィットしたαとγからHessian減衰指数sを無パラメータで約2%の中央誤差で予測する。アーキテクチャ適応型前処理行列T(σ;α)を提案し、Spectral Newtonオプティマイザが視覚ベンチマークでAdamWを上回ることを示す。
短期レンタル市場の動的価格設定は、財務リスクが高く、説明可能性が求められ、フィードバックが疎であるという課題がある。本論文では、コンテキストバンディットが価格を推奨し、人間のオペレーターが承認・修正・却下できるヒューマン・イン・ザ・ループ・ゲーテッド・バンディット(HITL-GB)フレームワークを提案。承認制約の下では、過去の価格データがオン・ポリシーのウォームアップデータと構造的に等価であり、コールドスタートを回避できることを示す。実際のSTR運用データ(匿名都市市場、2部屋、2022年4月~2026年4月、1,461件の価格設定エピソード)で検証し、ウォームアップによりコールドスタートを約150エピソードから約30エピソードに短縮した。この手法は臨床薬剤投与、与信審査、コンテンツモデレーション、放射線診断など、人間の承認が必要なハイリスク領域にも適用可能である。
本稿では、AI駆動型研究システム(ADRS)を分析するためのフレームワークGAMBLeを紹介する。ADRSの動作を4つのパラメータ(生成器、評価器、発見メカニズム、予算)と有効ランドスケープに分解する。760回以上の実験から、コンポーネントに完全な順序はなく、正しい選択により性能が13~67%、探索効率が6~39倍向上することが示された。
本論文は、組込みエージェントシステム向けのモジュール型参照アーキテクチャを提案する。デバイス上のエージェントとクラウド補完エージェントを分離する階層設計と、横断的なガバナンス層を統合することで、リソース制約のあるマイクロコントローラ上にLLMベースの自律システムを展開する課題に取り組む。
大規模推論モデルは推論ステップを増やすことで性能を向上させるが、正解に達した後の推論が有害である可能性を示す研究。接頭辞レベルの軌跡評価により、正しい接頭辞で停止すると精度が最大21%向上する一方、一般的な早期停止戦略は有害な過剰思考を軽減できないことを発見。論理的ドリフトと視覚的再解釈が主な原因。
本論文では、プレイヤーの衝突情報に基づいてビデオゲームの敵モフォロジーを生成する3つの新しいアプローチを探求し、プロシージャルコンテンツ生成におけるギャップを埋める。すべての手法はロボティクスから適応した進化的ベースラインと同等以上の性能を示した。
本論文では、縦断的電子健康記録から患者軌跡をモデリングする自己進化型マルチエージェントシステムTraj-Evolveを提案。経験プール(ExPool)とマルチエージェント強化学習(MARL)により、肺がん予測タスクで9つのベースラインを上回る性能を達成。ExPoolは特異度、MARLは感度を向上させる。
ChatHealthAIは、事前学習済みEHR基盤モデルからの構造化EHR表現を、タスク認識リサンプラーを介して凍結LLMの意味空間と整列させるマルチモーダル推論フレームワークです。縦断的患者表現と洗練された臨床イベント記述を統合することで、正確な患者予測を維持しながら、臨床に基づいた自然言語推論を可能にします。EHRSHOTベンチマークの3つの臨床予測タスクで評価した結果、競争力のある予測性能を維持しつつ、推論の質と解釈可能性が向上しました。
新しい研究では、エンコーダのみのTransformerとLSTMを、未観測流域での上流河川流量推論において比較しました。全体的にLSTMがTransformerを上回り、下流情報の組み込みにより中央値NNSEが60%以上向上しました。この結果は、再帰的メモリが上流再構成タスクに適していることを示しています。
AURA-Memは、ロボットポリシー向けの一定サイズのリカレントメモリを提案し、観測が次のアクションを変える場合のみ書き込みを行うことで、精度を維持しながらメモリ書き込みを大幅に削減する。学習されたゲートはアクション誤差信号で訓練され、推論状態は4,224バイトに固定され、KVキャッシュは成長しない。実験では、成功率を維持しつつ書き込みを最大7倍削減。
MITとMIT-IBMコンピューティング研究ラボの研究者らは、100万以上の多様なグラフを含むChartNetデータセットを開発し、視覚言語モデルのトレーニングに活用。小規模なオープンソースモデルが大規模な商用モデルを凌駕し、予算の限られた中小企業でもAIを活用しやすくなると期待される。