本稿は、大規模AIメモリシステムにおける4つの構造的障害モードを分析する:コサイン類似度はドメイン内の信念を区別できず、抽出品質は検索精度を予測せず、セッションドリフトがノイズを蓄積し、レイテンシ数値はセッションレベルの劣化を隠す。解決策として、語彙プライミングを活用したエイリアス加重BM25を提案する。
AI ニュース速報
リアルタイム監視
最新ニュース
信頼できる情報源、出典、権限、サイト内閲覧を保ちながら、AI の変化を読める情報に圧縮します。
最新ニュース
Chatr は、カスタマーサポート、フィードバック収集、予約、製品販売を処理するAIツールです。
本論文では、機上エッジコンピューティングを備えた異種移動ロボット向けのモダリティ適応型非接触呼吸数モニタリングフレームワークを提案する。RGB、熱画像、近赤外線(NIR)、低照度カメラにわたる輝度適応型センサ選択、キーポイント誘導による胸部ROI抽出、信号品質指標(SQI)ベースのフィルタリングを組み合わせる。四足および車輪型プラットフォームでの実験により、プラットフォームごとのアルゴリズム再調整なしでの汎化が実証された。RGBは最長8m、NIRは6mまで有効、熱画像は短距離のみ、低照度は完全暗闇で8mまで対応可能。本フレームワークは危険環境における自律トリアージと被災者評価の基盤となる。
新しい研究では、逐次凸計画法(SCP)におけるトランスフォーマーベースの学習ウォームスタート手法を提案し、宇宙マニピュレータの回転物体への終端接近において、反復回数28%、実行時間23%を削減しつつ最適制御コストを維持する。
本論文では、軽量なパーソナライズド埋め込みモデル(PEM)と選択的な大規模言語モデル(LLM)支援を組み合わせたハイブリッドフレームワークAPOLLOを提案する。これは、散らかった部分的に誤った環境での棄権認識型物体再配置を実現する。PEMは少数のデモンストレーションで訓練され、CPU上で動作し、不確実性推定を出力する。推定値が高い場合のみLLMを呼び出し、効率、プライバシー、推論能力のバランスを取る。また、新しい合成データセットAPORを導入する。実験により、APOLLOはLLM使用量を削減しつつ、従来のベースラインと同等以上の性能を示す。
ロボット工学における視覚エンコーダは、大規模なペアデータ不足に悩んでいる。新たに提案されたCAIPは、一人称視点の人間ビデオから手の姿勢をロボットのエンドエフェクタ動作の代理として抽出し、対照学習で統一的な動作-画像表現を学習する。わずか88時間のロボットデータと32041時間の人間ビデオを用いて、CAIPは巧みな操作タスクで既存手法を30%以上上回る性能を示した。
ACE-Ego-0は、自己中心的な人間ビデオをロボット形式の擬似動作軌跡に変換し、信頼性を考慮した学習目標を用いることで、人間とロボットのデータを効果的に融合し、VLAモデルの事前学習とファインチューニング性能を向上させる統一フレームワークである。
本論文では、時空間知識グラフとセグメントレベルの文脈メモリを組み合わせたハイブリッドメモリフレームワークVL-MemKnGを提案し、長期の自己中心視点ビデオにおけるナビゲーション質問応答を実現する。WalkieKnowledgeT+ベンチマークにおいて、Top-1検索精度を58%から67%に、Recall@1を34.50%から40.55%に向上させ、Gemini 2.5 ProやQwen 3.5+を含むすべての比較手法を上回った。
本論文では、マルチビュー知覚と大規模言語モデル(LLM)のシーン理解能力を活用したエンドツーエンド自動駐車フレームワーク「ParkingTransformer」を提案する。軌道クエリとLLMの暗黙状態特徴を組み合わせ、密なBEV表現を排除して計画軌道を直接出力。3D位置符号化、固定ウィンドウストリーミング機構、粗密デコード戦略を導入。CARLAシミュレータでは運転スコア61.32、実世界実験では平均成功率88.70%を達成。
HRDXは、約40時間(1,400km)の走行データを含む大規模なベクトルHDマップ構築用データセットであり、豊富な意味アノテーションと航空オルソ画像を備え、自動運転研究を支援します。
大規模言語モデル(LLM)を活用して、URDFモデルからロボットの意味的抽象化を自動生成する予備的アプローチ。多数決投票と構文検証により信頼性を向上させる。
SierpinskiCamは、単眼ビデオからのカメラ制御によるビデオ再撮影を改善する新しい手法であり、幾何学的ガイダンスにシェルピンスキードームテクスチャキューを追加することで、大きな視点変更下でもロバストなパフォーマンスを実現する。
OR3は、手術室映像をアクションドリブンデジタルツイン(ActDT)に変換し、大規模言語モデルを用いてクエリから仮想的なActDTを生成する想像ベース検索を提案。276の暗黙的クエリのベンチマークでR@1 57.6%、R@5 77.3%を達成。
統一マルチモーダルモデル(UMM)は指示チューニング中にモダリティ不均衡を示し、言語勾配が最適化を支配し、画像生成品質を低下させます。本論文では、Pareto LoRAを提案します。これは、勾配方向と強度を調整してテキストと画像の目的をバランスするパレート最適勾配統合戦略です。Emu2を用いたCoMMベンチマークでの実験により、テキスト性能を維持しながら知覚画像品質を最大44.9%向上させることが示されました。
既存の手術ビデオ質問応答手法はビデオを離散トークンに圧縮し、知覚と推論を結合するため、多段階推論が制限される。本論文は、強化学習フレームワークを導入し、手術基盤モデルから構築されたデジタルツイン表現上でLLMを動作させることで知覚と推論を分離する。階層表現と新しい報酬を導入し、大腸内視鏡ベンチマークREAL-Colon-Reasonを提案、複数のベンチマークで最先端の性能を達成。
REINSは、推論時に内部表現を安全な生成へと導くことで、ビデオ拡散モデルを訓練なしでアライメントする手法です。教師あり主成分分析を用いて安全と不安全の軌跡を分離する単一の方向を見つけ、中間トランスフォーマー層で適用します。9つのモデルで評価され、ビデオ生成分野で最も広範な安全性評価です。
GeoDisasterは、2,921のインスタンス、43の質問タイプ、5つのタスクファミリー(森林減少監視、マルチハザード分析、建物損傷評価、洪水安全経路計画、Sentinel-1 SAR洪水監視)を含む、運用型災害地理知能の新しいベンチマークです。異種のEO/GISデータを統合し、実行可能なワークフローを使用して真実値を生成します。本論文では、18の災害ツールを備えたオーケストレーション型マルチエージェントフレームワークと、役割契約期待整合(RCEA)を提案し、ツール使用と意思決定を改善します。
本研究は、30メートル解像度のLandsat-Sentinel-2画像を用いたビジョントランスフォーマーベースの沿岸藻類ブルームマッピングの初の成功例を示す。世界的に分布したブルームパッチデータセットを作成し、4つのトランスフォーマーアーキテクチャを畳み込みベースラインと比較した。Swin Transformerは雲やグリントのストレス下で従来のスペクトル指標法を凌駕し、誤検出を低減した。この知見は、動的な沿岸環境における中解像度藻類ブルームモニタリングのための信頼できるツールとして深層学習を支持する。
ベンチマーク評価は実デプロイにおけるエッジAI性能を20~30%過大評価することが明らかになった。Edge-TSRシステムは、NVIDIA Jetson Orin Nano上で検出・追跡・軽量な時間安定化機構を統合し、フレーム単位のベースラインと比較して最大10.16%の分類精度を回復。55分間の走行テストでは、クラウドオフロードなしで安全な熱限界内で16.18 FPSを維持した。
マルチスケールCNN、スペクトル注意、双方向状態空間モデリング、量子インスパイア学習を組み合わせたBiSpectral Mambaフレームワークを提案。UAVHSI-Cropデータセットで84.83%の分類精度を達成し、高次元性やクラス不均衡などの課題に対処。
新しい研究により、現在の視覚言語モデル(VLM)の多言語評価が複数スクリプト言語のユーザーを見落としていることが明らかになりました。研究者らは、パンジャブ語の3つのアクティブなスクリプト(グルムキー、シャームキー、ローマ字)にわたる厳密に平行な1,000の画像テキストインスタンスからなるベンチマークPuMVR(パンジャブ語マルチモーダル視覚推論)を導入しました。10の最先端VLMを評価した結果、モデルがあるスクリプトでは成功するが別のスクリプトでは失敗するという体系的な「スクリプトギャップ」が明らかになり、精度差は最大16%に達しました。視覚入力は性能を向上させるがギャップを埋めず、スクリプト間のコンテキスト内転送は脆弱です。著者らは、スクリプトに依存しない評価の必須指標として、最低24.8%にまで低下するスクリプト一貫性率(SCR)を提案しています。
約130語しかない人工言語トキポナを用いてWord2Vecをテストした研究では、その有効性が語彙数よりも分布パターンに依存することが判明した。
本論文は、LLMベースの音声認識における言語誤認識の問題に対処し、ソフトプロンプティング手法を提案、言語順守指標を定義し、ゼロショットプロンプティング、教師ありファインチューニング、思考連鎖推論の3つの緩和戦略を評価する。
本論文では、MLLP-VRAIN研究グループによるIWSLT 2026同時音声翻訳トラックへの参加について述べる。システムはParakeetとQwen 3.5モデルを利用し、適応型ブラックボックス戦略によるカスケード型ソリューションを採用。品質とレイテンシのトレードオフを改善するため戦略の緩和も検討。すべての言語方向に参加し、En→De、It、Zh方向ではASR単語ブーストとオフライン事前翻訳サンプルのRAG機構を組み合わせた新たなコンテキストトラックに参加。MCIF En→Deテストセットで+5.82 XCOMET-XLの品質向上、コンテキスト処理でさらに+1.03の改善。
本研究は、ボリュームCTレポート生成のためのパラメータ効率的な適応戦略を調査し、軽量な診断事前情報条件付けフレームワークRAD3D-Prefixを導入する。LLMを凍結し、投影層のみを訓練することで、訓練可能パラメータを最小限に抑え、過学習を軽減する。9610万から16億パラメータのLLMにわたる系統的な実験により、微調整は小規模LLMに有益である一方、大規模LLM(10億以上)を凍結することが優れたトレードオフを提供することが明らかになった。RAD3D-Prefixは、自動評価指標と臨床読者研究においてベースラインを上回り、強力なドメイン外汎化を示す。
本研究は、LLaDA2.1拡散言語モデルのトークン間(T2T)エディタにおけるトレーニングと推論のミスマッチに対処するため、自己生成T2T法を提案する。この手法では、勾配なしのドラフトパスを実行し、マスクされた位置を予測トークンで埋め、2回目のパスで自己生成された誤りからの回復を監督する。LLaDA2.1-miniにLoRA継続事前学習を適用し、編集強度を低減しながら精度を向上させ、最終桁の転写誤りや過度な自己修正などの失敗モードを軽減する。
この研究は、両者が自律型AIエージェントであるオンラインコミュニティにおいても、パラソーシャルインタラクション(PSI)の手がかりが存在するかどうかを調査した。Moltbookの4,434件の投稿と50,338件のコメントをキーワードマッチング、少数ショット大規模言語モデル(LLM)アノテーション、グループ化コンテキストLLMアノテーションの3つの方法で分析した結果、PSIの口語的手がかりが広く見られ、投稿者(OP)の再エンゲージメントや互酬的な返信構造と強く関連していることが明らかになった。二者間持続性テストにより、互酬的オファーが持続的なOP関与の相互再帰パターンと一致することが確認され、インタラクションレベルのPSIスクリプトとリレーションシップレベルの持続的二者パターンを結びつける実証的証拠が得られた。
RepSelectは、重み勾配の主成分を崩壊させることで忘却セット固有の表現を分離し、既存手法よりも4〜50倍優れた逆転耐性を達成する新しいLLMアンラーニング手法です。
PromptMNは、% プレフィックスの指示で自然言語プロンプトに注釈を付け、役割や目標、制約などを明示化し、エージェントワークフローにおける曖昧さを低減する軽量なドメイン固有言語です。非形式的なプロンプトと疑似コードの中間に位置し、逆プロンプトエンジニアリングをサポートし、最先端モデルでファインチューニングなしに検証されています。
MemSlidesは、長期記憶(ユーザープロファイル記憶とツール記憶)を作業記憶から分離する階層型メモリフレームワークを提案し、スライド局所修正と組み合わせることで、タスク間でのユーザー嗜好の維持と複数回の修正にわたる信頼性の高い局所編集を実現する。実験では、パーソナライゼーションの一致度、修正動作、嗜好の持ち越しにおいて改善が示された。