本論文は、ツリー上のマルチエージェント経路探索(MAPF)の複雑性を、距離、メイクスパン、フロータイムという標準的な目的関数と、ラベル付きおよび色付きのバリアントに対して解決するシンプルなフレームワークを提示する。ツリー上でのラベル付きおよび2色MAPFがすべての目的関数でNP困難であることを証明し、古典的なペブル移動問題を解決する。すべての結果は、スタック再配置問題のNP困難性を通じて確立される。
AI ニュース速報
リアルタイム監視
最新ニュース
信頼できる情報源、出典、権限、サイト内閲覧を保ちながら、AI の変化を読める情報に圧縮します。
最新ニュース
本論文は、日常のインターネット動画をロボット操作ポリシーの共訓練に利用する際に転移を左右する要因を調査している。著者らは532本の人間動画、28時間の高品質な三角測量による手ラベルを含む新データセットを構築し、手のポーズ品質が転移に影響するが、正確な手でも動作ギャップが存在し、視覚・ポリシーネットワークが各実施形態に特化しない限り転移を妨げることを発見した。提案する共訓練レシピにより、低ロボットデータ環境で6つの操作タスクにおいて成功率が29.7%絶対的に向上した。
ロボットによる物理パズルの操作は自動組立・分解タスクに重要だが、訓練データセットの生成は時間と手間がかかる。PhyRoGenフレームワークは手続き型コンテンツ生成を活用し、操作パズルの合成データセットを自動生成する。6つの具体生成器で24個のパズルを生成し、シミュレーション内でKUKAロボットによる操作を実証した。
本論文は、汎用ロボット知能のボトルネックはポリシー学習だけでなく、非構造化行動データをロボットの教師信号に変換するメカニズムの欠如であると主張する。著者らはデータ、身体性、ワールドモデル、報酬の4つのインターフェースを提案し、より広い物理世界から学習するロボットシステムの構築を提唱する。
ディープフェイク検出システムはベンチマークではほぼ完全な精度を達成するが、法医学的展開には信頼性の高い予測不確実性が必要である。提案された相関最適化融合(COF)は、5つの補完的な不確実性源を融合し、わずか42秒の最適化で済む。分布シフト下では他の手法を上回るが、データセット間評価では壊滅的な汎化失敗を示し、ドメイン適応型UQが重要な課題であることを明らかにしている。
ViSAEは、神経科学に着想を得た概念回路を用いてVision Transformer(ViT)を解釈・制御するツールボックスであり、解釈可能性と最悪グループ精度を大幅に向上させます。
DIRECTフレームワークは、挿入条件を外観、幾何、コンテキストのガイダンスに分解することで、ポーズ制御可能なオブジェクト挿入を実現し、幾何学的制御性と視覚品質において既存手法を上回る。
本論文ではDTG-FFを提案し、複数の実データベンチマークでFF(Forward-Forward)学習の最先端を達成したが、実データではバックプロパゲーション(BP)がFFを大きく上回り、クラス数増加に伴い差が拡大すること、合成タスクがFFの転送可能性を過大評価すること、公平なハードウェア比較ではFFのメモリ優位性が成立しないことを示した。
WorldBenchは、視覚的多様性を重視した新しいマルチモーダル推論ベンチマークです。数千の視覚概念からなる分類体系を構築し、検索エンジンや既存データセットから画像を収集し、最先端のMLLMが誤答するような問題を設計しました。15のモデルを評価したところ、最強モデルでも正解率は64.0%にとどまり、ベンチマークにおける視覚的多様性の重要性が浮き彫りになりました。
提案AE-YOLOフレームワークは、軽量ボトルネックオートエンコーダ、CBAM、分散最大化正則化を統合し、UAV画像における絶縁体欠陥検出のクラス不均衡、スケール変動、小目標問題に対処。データセットで95.10% [email protected]を達成し、YOLOベースラインを5.0ポイント上回る。
本論文は、複合現実におけるコックピット画像の前景・背景セグメンテーションにU-netおよびDeepLabV3+の畳み込みニューラルネットワークを適用し、CAT793Fトラックシミュレータの画像で約90%の精度を達成したことを報告する。
本研究では、オン・ポリシー蒸留(OPD)を用いて自己回帰モデルを拡散言語モデルに変換するオン・ポリシー拡散言語モデル(OPDLM)を提案する。従来手法の分布シフト問題を解決し、多様なタスクで従来の15分の1から7000分の1の学習トークン数で強力な性能を達成する。
Webエージェントは各アクションステップで完全なDOM(通常数万トークン)を読み取り、コンテキスト劣化を引き起こす。本論文では、専用サブコールでDOM全体を読むがタスク関連要素のみを返し、軽量シグナル検出器が発火したときのみ再呼び出しする信号駆動観測(SDO)を提案。観測圧縮をアーキテクチャ上の核心的決定として扱うよう呼びかけている。
75か国1500件の自由回答を分析した結果、人々がAIに求める価値観は極めて多様で矛盾していることが判明。ほとんどの価値観は回答者の4分の1未満しか挙げず、「真実性」だけが49%で例外だったが、その定義は「根拠のある主張」「専門家の意見」「不人気な見解」など様々。一部の能力(人間らしさ)や機能(ガードレール)は賛否両論。研究者は、現在のRLHFによる調整方法は文脈に応じた複雑な選好を単一モデルに押し付け、「認識的暴力」を引き起こすと警告している。
ピギーバック仮説は、チャットテンプレートトークンが微調整された振る舞いをドメイン外のクエリにピギーバックすることを提唱する。プレフィックス摂動によって検証され、トークン正則化微調整(TReFT)が創発的ミスアライメントを緩和する。
自然テキストからの複雑な推論の形式化は、計算言語学における中心的な課題です。現在の議論マイニング技術は基本的な主張と前提を識別できますが、カーネアデス議論フレームワーク(CAF)のような高度なスキーマに必要な豊富な構造情報を捉えるのに苦労しています。CAF-Genは、反復的な作成者・レビューパイプラインを使用して浅い議論構造をCAF準拠のモデルに強化する自動化されたマルチエージェントフレームワークです。実験では、反復フィードバックループがデータ品質を向上させ、元のアノテーションと強い一致を示しました。
本研究では、トークンレベルの不確実性信号を用いて、言語モデルの推論失敗を2つの異なるプロセス(コミット型失敗と持続的不確実性)に分類。23のモデル・データセット構成で検証し、20例で予測が成立。自己整合性への応用可能性も示す。
UnpredictaBenchは、大規模言語モデル(LLM)が真の分布を捉える能力を評価する新しいベンチマークです。LLMが経済シミュレーションなどで人間の代わりとして使われるようになる中、多くのモデルが単一の答えに収束する傾向があり、現実システムの予測不可能性を捉えられません。このベンチマークは448の問題から構成され、典型的な統計分布、確率的プログラムによる分布、ランダムプロセスを記述した自然言語シナリオを含みます。KS@N指標を用いて、モデル出力が目標分布にどれだけ近似しているかをKolmogorov-Smirnov検定で評価します。実験の結果、モデルのスコアは大きなばらつきを示し、KS@100では0%近くから20%超まで分布し、40%を超えるモデルはありませんでした。推論を追加するとスコアは多少向上しますが、根本的な解決にはなりません。UnpredictaBenchは、単純な分布シミュレーションでさえ困難であり、複雑なシステムの代役としてLLMを使うための第一歩として必要であることを示しています。
この研究は、550の人間会話と3段階のパーソナライゼーションに関する判断データを収集し、LLMのパーソナライゼーション能力において合成データと人間データの間にギャップがあることを明らかにした。属性抽出、選択、応答生成の各段階でモデルが苦戦し、人間の評価に適合する品質判断は依然として困難である。
大規模言語モデルは主に英語データで訓練されるため、多言語での事実想起に課題がある。本論文では、12言語にわたる10万件のWikidata事実を含む大規模並列多言語事実QAデータセットPolyFactを導入。Qwen-2.5-7BとOLMo-2-1124-7Bを用いて、軽量継続事前学習、教師ありファインチューニング、GRPOベースの強化学習を比較。GRPOが一貫して優れ、言語間の一貫性と未学習言語への汎化を向上。メカニズム分析により、GRPOがMLP層とアテンションヘッドの言語特化を減らし、共有表現を促進することが示された。コード、モデル、データセットを公開。
GPLFRと呼ばれる新しいモデルは、ガウス過程事前分布からの低次元潜在状態の線形ガウス復号により高次元出力を表現し、圧縮と予測を統合。低データ領域に適し、岩石系太陽系外惑星の全球気候モデルの空間分解エミュレータ構築に初めて応用された。
大規模言語モデル(LLM)の層をスキップまたはループさせ、入力ごとにカスタマイズされたプログラムを動的に実行する手法PoLarが提案された。数学的推論ベンチマークにおいて、より少ない層で同等以上の精度を達成し、固定深さの推論が能力を十分に引き出せていないことを示唆する。
本論文は、現在のAGIに満たない能力レベルの生成モデルが知識生産と文化継承に構造的リスクをもたらすと主張する。人間の時間的学習(HTL)を、問題への継続的な関与を通じた経路依存的な知識蓄積と定義する。生成モデルの出力は表面特徴においてHTL集約的作業にますます類似しており、真の人間学習を検証するコストが期待される便益に対して増大する。検証が経済的正当性を失うと、評価者は生産手段に関わらず出力を報奨し、何年もの学習に投資した生産者はほぼゼロコストで生成される出力と価格競争を強いられる。この経路を「価値崩壊」と呼び、高コスト検査フレームワークで形式化する。学術出版、法務実務、コンテンツプラットフォーム、ソフトウェアセキュリティからの分野横断的証拠が、検証侵食の4段階にマッピングされる。アライメントの成功は直交する。より良いアライメントは人間とAIの出力間の観測可能なギャップを狭め、個々のAI出力が改善してもソース検証を困難にし、HTL集約的作業への競争圧力を強める。
記号回帰(SR)は、数学関数の空間を系統的に探索し、データセットの背後にある関係を正確に捉えるモデルを発見する手法です。近年の進歩にもかかわらず、不確実性定量化(UQ)のサポートが不足しているため、実際の意思決定プロセスへの採用が制限されています。本サーベイは、この問題に初めて明確に取り組み、UQの基本概念を紹介し、SRにおけるUQの既存文献を頻度論、ベイズ、モデル選択の3つの研究方向に分類してレビューします。SRにおけるUQはまだ十分に探求されておらず、信頼性の高いUQ手法のさらなる研究が動機付けられています。
本論文では、深層デコーダのみのTransformer向けに、軽量なマルチレゾリューション残差ルーティング手法WAV v1を提案。標準的な残差ストリームは固定重みで集約するが、WAV v1は各ブロックに位相ベースと分割ベースの2つの方向性詳細ベースを追加し、注意とMLPの不均衡や初期・後期サブレイヤーダイナミクスを捉える。これらをブロック要約と共にルーティングし、負の初期化と分離RMSマッチングで訓練を安定化。文字レベルのTinyStoriesとText8言語モデリングで、12層では一貫しないが24層で競争力を持ち、48層では全てのベースラインを凌駕。48層での検証損失はBlock AttnResと比較してTinyStoriesで0.4960→0.4738、Text8で0.9363→0.9305に低減し、パラメータ増加は無視できる。方向性残差詳細が深層Transformerのスケーリングに重要であることを示す。
MacArenaは、macOS上のコンピュータ使用エージェント(CUA)を評価するための、50アプリケーションにわたる421の手動検証済みタスクからなる新しいベンチマークです。OSWorldのタスク、macOSWorldのコンテンツ、および49の新しいmacOSネイティブタスクを組み合わせ、Apple Silicon上のAppleのネイティブVirtualizationフレームワークで動作します。評価の結果、macOSはLinuxベースのベンチマークでは捉えられない独自のGUI課題を提示し、移植タスクとmacOSネイティブタスクでモデルのランキングが逆転し、リーディングモデルがMacArenaサブセットで26%以上遅れをとることが明らかになりました。
新たな研究で提案されたMSFAN深層学習アーキテクチャは、テラヘルツデュアルコム分光法と組み合わせて12種類のポリマーを85.2%の精度で分類し、プラスチックリサイクルの選別効率向上に貢献する可能性を示す。
拡散大規模言語モデル(dLLM)はトークンを反復的に洗練するが、一度コミットすると不可逆的であり、初期の決定が脆弱なまま残る「安定性のラグ」を引き起こす。ポストトレーニング量子化(PTQ)誤差は、書き込みフロンティアでこれらの境界上の決定を容易に反転させ、永久に固定・増幅する。この問題に対処するため、FAIR-Calibを提案する。これは2段階のPTQフレームワークで、第1段階で完全精度の教師モデルをプローブして位置事前分布(フロンティアヒットとマスク段階の信頼性を組み合わせる)を推定し、第2段階で重み付けされた隠れ状態MSEを最小化することでオフポリシーの層別キャリブレーションを実行し、高価なエンドツーエンドの拡散ロールアウトを必要とせずに脆弱なフロンティア状態の保護を優先する。理論的には、重み付け目的関数が出力KLダイバージェンスの代理であることを正当化する。実験では、FAIR-CalibはLLaDAおよびDream(W4A4)において最先端のベースラインを一貫して上回り、フロンティア決定の反転を大幅に削減し、コミット後の不整合を抑制する。
本論文では、教育シナリオにおけるLLM評価のための細粒度ルーブリックを自動構築・洗練・適用するエンドツーエンドフレームワークElmes*を提案する。宣言型マルチエージェントエンジンと自己進化モジュールSceneGenを組み合わせ、評価基準とテストデータを共最適化する。構築されたEdu-330ベンチマークは、11科目、3学年、10タスクタイプにわたる330シナリオをカバーし、1000以上の二次指標を含む。実験により、教育能力は多次元であり、トップLLMは主に創造性と価値観統合で異なり、知識重視モデルはソクラテス的足場かけに失敗する可能性があること、教育特化型InnoSparkが最高の人間評価スコアを達成したことが示された。LLM評価者は人間と同等のランキングを維持するが、自己選好などのバイアスを示す。本フレームワークは、教育学に基づいたLLM評価のためのスケーラブルな診断インフラを提供する。
本論文は、対称疑似ブール制約を持つSAT問題に対する並列連続局所探索(CLS)の応用を研究する。問題を超立方体上の連続最適化に緩和し、実験により、冗長制約は収束を阻害すること、CLSはハイブリッド設定で部分割り当てを迅速に完了できること、鞍点の多い目的関数により局所探索が解品質の安定分布に急速に収束することを明らかにした。これらの知見は、最新アクセラレータハードウェア上でのCLSによるSAT求解の実用的利用に役立つ。