MuJoCo-Drones-Gymは、MuJoCo物理エンジンに基づくオープンソースのマルチドローン環境です。任意数のCrazyflie 2.xナノクアッドコプターをサポートし、物理モデル、アクションインターフェース、観測空間を選択できるモジュラーAPIを備え、PettingZooラッパーによるマルチエージェント強化学習と7つのタスク環境を提供します。
AI ニュース速報
リアルタイム監視
最新ニュース
信頼できる情報源、出典、権限、サイト内閲覧を保ちながら、AI の変化を読める情報に圧縮します。
最新ニュース
IntentNavは、人間のデモンストレーションから人間らしい物体ナビゲーションポリシーを学習するフレームワークです。フロンティアベースの意図ラベリングにより高レベルの探索意図を推論し、空間視覚候補空間を構築して効率的な探索を実現します。複数のベンチマークで最先端の性能を達成し、さまざまなロボットプラットフォームにゼロショット転送されます。
Q-VGMは、オフポリシー強化学習手法であり、価値勾配をノイズ除去時間価値勾配場に変換するVGG-Flowを活用することで、フローマッチングVLAポリシーの微調整における数値的不安定性を回避します。LIBERO、RoboTwin 2.0、実ロボットタスクで高い成功率を達成。
PRISMは、軽量MLPを介してワールドモデルのエンコーダから状態条件付きガウス事前分布を抽出し、精度加重ガウス積更新を用いてプランナーのサンプリング分布に融合することで、連続制御タスクの成功率を大幅に向上させるタスク非依存フレームワークです。
本論文では、単一のXRデバイスを使用し、ロボットの形態を問わず再学習不要で汎用化できる階層型全身遠隔操作フレームワークX-OPを提案する。MPCベースのモーションリターゲッターがオペレーターの意図とロボットの動的実現可能性を同時に最適化し、状態同期とSLAMグローバルポーズフィードバックによりロバストな実行を実現。シミュレーションでは、ヒューマノイドで完了時間30%以上短縮、消費電力20%低減、移動マニピュレータで衝突ゼロを達成。実世界実験でも有効性と柔軟性を確認。プラグアンドプレイのフレームワークは、スケーラブルで形態に依存しない全身遠隔操作を提供し、リアルタイムの行動カスタマイズを可能にする。
研究者らは、時間畳み込みネットワークを用いたリアルタイムエンドツーエンド義足コントローラを開発し、手動チューニングと意図分類器を不要にした。平らな地面、坂道、階段の5つの動作モードでテストされ、コントローラは訓練データのスケーリングに一致し、被験者固有の調整なしで自然な階段遷移を可能にした。
本論文は、脅威環境における自律走行車の経路計画に深層決定論的方策勾配法(DDPG)を適用する手法を提案する。脅威は複数の円形進入禁止区域としてモデル化される。DDPGエージェントは試行錯誤を通じて状態から行動への直接マッピングを学習し、報酬関数は目標引力、障害斥力、制御エネルギーペナルティで構成される。従来の疑似スペクトル最適制御と比較して、DDPGは有効な経路を生成しつつ大幅に高速であり、リアルタイム応用に適する。
MinNavはオプティカルフローとその不確実性に基づくナビゲーションスタックで、小型空中ロボットが静的・動的障害物や未知形状の隙間を事前知識なしで飛行することを可能にする。実世界実験で70%の成功率を達成し、はるかに少ない計算量で深度ベースの手法と同等の性能を示す。
本論文では、VLMを用いて異種ロボット能力を中断可能なツールとして編成するVoLoAgentを提案する。物理世界でのリアルタイムな計画、監視、回復を実現する閉ループエージェントを導入し、新しいベンチマークRoboVoLoで評価。単一VLA/VLMやツールベースシステムを大幅に上回る性能を示した。
NeuroAlignは、fMRIとDTIデータを統合し、軽度認知障害(MCI)を解析するための階層的多モーダル融合フレームワークです。デュアルモーダル階層アライメント(DMHA)とデュアルドメイン階層インタラクション(DDHI)モジュール、および勾配不要の帰属手法であるSynergistic Activation Mapping(SAM)を導入し、複数のデータセットで競争力のある性能を達成しました。
AMN(適応的多スケール核ネットワーク)は、Swin TransformerとResNet-50特徴ピラミッドを学習されたチャネルごとのゲーティング機構で融合するデュアルエンコーダーセグメンテーションフレームワークである。CoNICベンチマークで平均Dice 0.82、平均F1 0.68を達成し、8つのベースラインを凌駕し、MoNuSegでも強力な汎化性能を示す。
本論文は、密集した非構造化都市交通における自動運転の認識課題に取り組み、セクター単位のパノラマ処理と回転同変スパース畳み込みを組み合わせた360度LiDAR認識フレームワークを提案する。インドの多様な交通条件下で収集したカスタムデータセットを用いて評価した結果、車両(92.02/90.51)、バス(80.53/76.34)、トラック(78.59/74.16)では高い検出性能を示す一方、歩行者(67.45/61.02)、自転車(73.21/69.54)、オートバイ(71.20/68.13)では低いスコアとなり、小型で可変性の高い交通参加者の検出が困難であることが示された。
本論文では、Vision Transformer(ViT)の信頼性を統計的に保証するフレームワークSENTRYを提案する。有限母集団サンプリング理論を活用し、数千サンプルのみで99%信頼水準で故障率を1%以内に抑え、実験コストを最大10,700倍削減する。調査により、FP32ビット反転のわずか3%が故障を引き起こすが、その大部分が壊滅的な精度低下をもたらし、脆弱性は正規化層とIEEE-754形式の重要な指数ビットに集中していることが明らかになった。
人間と最先端のマルチモーダル大規模言語モデル(MLLM)が、本物の法的証拠写真とAI生成の偽物をどれだけ見分けられるかを調査した研究。200枚の本物と1200枚の合成画像からなるデータセットSLED-1400を構築。人間の全体的な正解率は64.8%で、最強の生成器に対してはほぼ偶然のレベル。MLLMは本物を見逃すことはなかったが、多くの合成画像を見逃した。いずれも単独では信頼できず、訓練された人間のレビュー、MLLMスクリーニング、C2PAのような来歴インフラの組み合わせを提唱。
本論文では、ビジョン・ランゲージエージェントにおいて、画像内の機密テキストがツール引数にコピーされる「アクション境界伝搬」障害を評価するベンチマークVisualLeakBenchを紹介する。ベースラインではPII伝搬率78.8%、不安全テキスト伝搬率85.5%。防御プロンプトによりPIIは2.0%に低下するが実用性が損なわれ、不安全テキストは52.6%にとどまる。
MITの研究者らは、画像摂動に対するロバスト性を向上させるため、ビジョントランスフォーマー(ViT)の敵対的ファインチューニングを分析した。特定の劣化(低周波・高周波)でファインチューニングすると、その劣化に対する性能は向上するが、未学習のタイプには一般化しないことを発見した。注意機構や知識の進化に変化が見られたものの、スパース表現は不変であった。
SlideCheckは、凍結された病理基盤モデルのパッチ特徴を利用して全スライド画像の異常性と悪性度をスコアリングする軽量ツールであり、事前学習データの構成をより良く制御できるようにします。実験により、SlideCheckが定義するデータ分布が下流のViT事前学習性能に影響を与え、キュレーションされたパッチサブセットが全データの性能に近づくことが示されました。
本博士論文は、個人レベルの手がかりではなく集団の音声・映像信号を用いて感情を推論する、プライバシー保護型の集団感情認識(GER)フレームワークを2つ提案する。第1はクロスアテンション融合とフレーム注意プーリング、第2は変分エンコーダ多デコーダによる共有潜在空間学習である。個人特徴を入力とせずに競争力のある性能を示した。
48,000枚以上の注釈付き歴史文書ページ画像でファインチューニングされた画像分類器が、RegNetY-16GFを用いて99.16%の精度を達成。OCRやデータ抽出のための自動分類を可能にする。CLIPモデルはテスト精度は高いが、未ラベルデータでは性能が低下。
本論文では、Sinkhorn最適輸送に基づくMST-Directを拡張し、多変量・条件付き・大規模な地統計シミュレーションを実現する。スパースな候補制限付きSinkhornマッチャーによりメモリ複雑性O(nC)でスケーラビリティを改善、FFT-MAガウスバックボーンを用いて多変量に拡張、クリギングによるハードデータ条件付けを可能にする。6変量不均一分散分布での検証では、ヒストグラム誤差ゼロで正確な空間相関を再現し、PPMT近似を上回る。
本論文では、未解決部分空間実験誘導、明示的曖昧性解消、残差ベースのライブラリ不十分検出を組み合わせたAI科学者向け検証層CARTOGRAPHを提案する。5つのテストベッドで生の投影法を上回り、ライブラリ外のメカニズムを暫定的に特定し、その後取り消す能力を示す。A-Lab自律材料システムの40件の肯定的主張の回顧的監査では、後に不確定とされた4件すべてをフラグし、確認された36件中32件を通過させた。
拡散言語モデル(DLM)では双方向注意機構により既存のKVキャッシュ手法が機能せず、精度がほぼゼロになる。本論文は双方向プレフィックスキャッシュ(bicache)を提案し、安全なレイヤー深さを動的に特定して共有プレフィックスKVを再利用することで、スループットを36.3%~98.3%向上させ、精度低下はわずか0~1.8%に抑える。
正確な炭素排出モニタリングは気候政策に不可欠ですが、都市レベルの高頻度データは極めて不足しています。TriHead-GANはTransformerベースの敵対的フレームワークであり、トリプルヘッド識別器が分布の真正性、変数間依存性、時間的平滑性の3つの側面を共同で監視します。実験では、主流のベースラインを上回り、低リソース環境での下流予測を改善することが示されました。
STARIXNet は、複数のシステムメトリクス間の時空間関係を捉え、多変量空間でリソース割り当てを導く軽量ニューラルネットワークであり、サービス安定性とコスト効率を優先する。Walmart の重要プロダクションマイクロサービスに導入され、10~50%のコスト削減とサービス安定性・顧客体験の向上を実現した。
新たに提案された階層的創発フレームワーク(HEF)は、創発をメカニズムランドスケープにおける相転移としてモデル化し、機械学習、生物学、物理学における独立した進化システムが類似した高次構造に収束する現象を説明する。モジュラ算術Transformerを用いた111回の実験では、重みノルムが創発前にピークに達し、すべての創発モデルが0.9745±0.014の精度に収束することが確認され、HEFの予測を支持した。
本論文は、群トポロジーを圧縮テンソルネットワークとしてモデル化することで、指数関数的な動作空間と通信オーバーヘッドを克服するSPINフレームワークを提案する。
研究者らは、再トレーニングなしで医用画像分類に最適なモデルを推薦するTransformerベースの推薦システムMedicalRecを提案する。エネルギー消費と試行錯誤の無駄を削減する。このシステムは、3,000件の論文から収集した5,000件以上のレコードを含むベンチマークデータセットMedicalRec-Benchを使用し、評価で最大HitRate@100 75.5%を達成した。
オフライン強化学習は、歴史的なトカマクデータからプラズマ制御器を開発する有望な手法だが、標準化されたベンチマークの欠如により進捗の測定が困難である。本論文では、DIII-Dトカマクの実際の放電データに基づくオフラインRLベンチマークRL4Fを提案する。回転、密度、温度、圧力の4つの全プロファイル追跡タスクをカバーする。評価の結果、オフラインモデルベースのRL手法がほとんどの目的で平均的な性能が最も良いが、単一の手法が全タスクを支配するわけではなく、複雑な長 horizon プラズマ制御タスクにおける動的モデリングの重要性が示された。コードベース、データセット、評価フレームワークはオープンソース化されている。
本論文は、マルチモーダル推論における新しい手法「最悪次元最適化(Worst Dimension Optimization)」を提案します。従来のプロセス報酬モデル(PRM)はすべての次元(視覚的根拠付け、論理的一貫性など)を等しく重み付けするため、個々の次元の失敗が主要な要因に隠れてしまう可能性がありました。新しい手法は推論パスの中で最も弱い次元に焦点を当て、全体的な推論の有効性を保証します。
本研究では、GRU-Neural ODE変分オートエンコーダであるGNOVAフレームワークを提案する。MRI、PET、CSFを必要とせず、ルーチンの臨床データのみでアルツハイマー病患者の認知スコア(CDR-SBおよびMMSE)を双方向に予測し、疾患軌跡の再構築と予測を実現する。ADNIデータセットの1727名の患者で平均絶対誤差1.35および2.28を達成し、年齢、BMI、APOE4ステータスが強力な予測因子であることを示した。