世界的に人気の拡張現実ゲームからの位置情報スキャンデータが、AIが物理空間を認識・解釈する訓練に使用され、戦場での軍事ドローン位置特定に役立つ可能性がある。
AI ニュース速報
リアルタイム監視
最新ニュース
信頼できる情報源、出典、権限、サイト内閲覧を保ちながら、AI の変化を読める情報に圧縮します。
最新ニュース
Appleのソフトウェア責任者Craig Federighi氏は、新しいSiriは他のチャットボットのようにお世辞を言ったり、ユーザーを引き込もうとしたりせず、あくまで支援に徹するよう設計されていると述べた。
Qursor は、任意のUI要素を指すことでその正確なコンテキストをAIアシスタントに送信できる革新的なツールです。Product Hunt でローンチされました。
本記事は、AIエージェントを手動でプロンプトするのではなく、自動ループを設計するという新たなトレンドを探ります。AnthropicのFable 5リリースとその論争、自動化されたAI研究システム、データインフラのボトルネック、推論速度の最適化、そしてエージェントツールの最近の進展をカバーしています。
Sparse2Actは、タスク空間のエンドエフェクタ動作を幾何学的な監督として用い、スパース点群エンコーダを観測と整列させる事前学習フレームワークである。LIBERO-10で86.9%の成功率、Meta-World-5へのクロスドメイン転移で73.4%、実世界実験で72.5%の成功率を達成。
EquiDexFlowは、物体点群から手首姿勢、関節角度、指先接触点、法線、接触力を同時に予測するSE(3)等変フローマッチングモデルです。接触点を物体表面に投影し、力をクーロン摩擦錘内に制約することで、損失ペナルティなしに配置と摩擦コンプライアンスを保証します。200回の回転テストで手首残差0.04°未満、関節偏差ゼロを達成し、全アブレーション変種の中で摩擦違反ゼロ、最高複合スコアを記録しました。物理ロボット上では、リターゲットされた把持が6つのテスト物体すべてでオープンループのピックアンドホールド試験に成功しました。
EWAMは、凍結されたCosmos3バックボーンネットワーク上に構築された閉ループオンライン適応アーキテクチャであり、推論時共推論メカニズム(4つの軽量ニューラルレイヤー)を用いてゼロショットタスク適応を実現し、追加のデモデータや微調整なしで新しいタスクレイアウトへの適応に必要なデプロイデータ量を大幅に削減します。
arXivの新論文はDARRMSアルゴリズムを提案。エージェントが動的に注意半径を制限して計算リソースを節約し、性能を維持しながらシステムの協調性と拡張性を向上させる。理論解析と実験により、リソース制約環境での有効性を示す。
EgoEngineは、自己中心的な人間の操作ビデオを高忠実度のロボット観察ビデオと実行可能な行動軌跡に変換するスケーラブルなフレームワークです。人間とロボットの間の視覚的および行動的ギャップを埋め、実際のロボットデモンストレーションなしでゼロショットの器用なポリシー学習を実現します。
FlowPilotは、単眼RGBカメラのみを使用する地図不要の長距離歩道ナビゲーションポリシーです。アンカー付きフローマッチングによる大規模ロボット群データでの事前学習と、人間参加型の選好学習スキームにより、社会的コンプライアンスと反事実推論を向上させます。シミュレーションでは成功率42%、経路完了率66%を達成し、実世界実験では介入率が40.0%、非介入率が52.1%低減しました。
本論文は、GPUを用いた世界モデリングとベクトル場ベースの計画を高速化し、最大5倍の高速化を実現するフレームワークG-MAPPを提案する。動的環境でのリアルタイム知覚-行動ループ結合を可能にし、7自由度Franka Emikaロボットで検証した。
本論文では、Foresightフレームワークを提案する。これは、テスト時に微調整された視覚言語モデルを用いて運動計画を反復的に提案と批評を行い、疎な言語指示によるマップレスナビゲーションを実現する。人間のフィードバックから報酬モデルを学習し、強化学習でVLMを後訓練することで、実際の環境でタスク成功率を37%向上、介入回数を52%削減した。
AEMという事前学習フレームワークは、視覚-動作履歴からコンパクトな時間表現を学習し、シミュレーションと実世界の操作タスクでベースラインを上回る性能を示します。
本稿では、模倣学習によるエンドツーエンドで訓練された視覚・言語・動作(VLA)モデルが協調操作を支援できることを示す。アクションチャンキングポリシーの障害モードとして、デモンストレーションアクションリークが早期の支援行動を引き起こすことを特定し、推論時ステアリング手法を提案する。長期協調組立タスクにおける16名の参加者によるユーザスタディでは、ステアリングにより実行期間が延長され、協調が高速化し、障害が減少することが示された。
VLADriveBenchは、視覚-言語-行動(VLA)モデルにおけるチェーン・オブ・ソート(CoT)推論が運転軌跡と関連性、一貫性、因果関係を持つかどうかを評価する新しいフレームワークです。観測指標(言及、幻覚、矛盾、行動アライメント)とCoT介入プロトコルを組み合わせています。3つのモデルに適用した結果、観測分析と因果分析が大きく乖離する可能性があることが判明しました。ORIONは観測アライメントで最高スコアを示しましたが、そのCoTは随伴現象であり、一方Alpamayo v1.5はスコアが低いもののCoTは強く因果的であり、視覚的顕著性がCoTの影響の程度を調整していました。
SalArt-VQAは、視覚言語モデル(VLM)がAI生成画像のアーティファクトを細粒度で理解する能力を評価するための診断ベンチマークです。950枚の画像と3,681問の多肢選択問題を含み、存在検出、意味的定位、空間的接地、証拠に基づく欠陥識別をカバーします。20のVLMをテストした結果、最強のモデルは検出再現率99.37%を達成したものの、全4問に正解した画像は53.26%のみであり、感度と較正のトレードオフが明らかになりました。
本論文では、オープンエンド画像テキスト生成におけるインクリメンタル学習のための効率的継続的アライメント(ECA)を提案する。継続的アライメントの概念と3つのコアメカニズム(クエリ混合モジュール、フィッシャー動的拡張、辞書リプレイ)により、ECAは過去のデータにアクセスせずに破滅的忘却を軽減し、新しいベンチマークで優れた性能を達成する。
局所文脈融合モジュール(LCFM)と大域文脈注意モジュール(GCAM)を用いたContext-Centric Feature Fusion(CCFF)フレームワークを提案。CityscapesとBDD100Kデータセットでカテゴリレベルの一貫性戦略(CCS)がそれぞれ0.973と0.969に達し、小物体検出AP_Sが14.1%向上、まれなクラス「Train」の復元に成功。リアルタイム処理を実現し、オーバーヘッドは0.2 FPSのみ。
既存のスロットベースの手法では、単一のスロットベクトルに外観と同一性をエンコードするため、スロットスワッピングが発生する。提案するデュアルステートスロットアテンション(DSSA)は、各スロットを局所状態(フレームごとの外観)と同一性状態(時間的に安定したオブジェクト情報)に分解し、競争変調集約(CMA)を用いて弱一致スロットの更新を抑制する。実験では、MOVi-C、MOVi-D、YouTube-VISにおいて、セグメンテーション品質と時間的一貫性が向上した。
医療用LVLMは事実の一貫性や視覚的根拠付けに課題がある。既存のアライメント手法は、シーケンスレベルの報酬、静的SFT参照への依存による分布シフト、視覚的根拠付けの欠如という3つの限界がある。提案手法は、双方向トークンワイズKL正則化器と視覚対比的根拠付け目的を用い、モデル出力を最小限編集して選好ペアを構築する細粒度オン・ポリシーアライメントフレームワークを形成する。実験で有効性を確認した。
少数ステップ拡散蒸留は4〜8ステップ生成では成熟しつつあるが、2ステップへのさらなる短縮は依然として困難である。本論文では、8ステップのZ-Image Turbo教師モデルから蒸留された高品質2ステップ画像生成モデルZ-Image Turbo++を紹介する。分布整合敵対的学習、ステップ分離パラメータ化、反復正則化付きエンドツーエンドトレーニングの3つの設計により、2ステップと8ステップ生成の品質差を大幅に縮小する。
大きなポーズやスケールの違いに対応できる3D認識型ヘアスタイル転送フレームワークで、バルドコンバーターと3D認識転送パイプラインを特徴とする。
本論文では、AMD Kria K26 SOM上で動作する低消費電力・携帯可能なビジョンベース転倒予測・検出システムを提案する。Intel RealSense D455カメラと3段階パイプライン(量子化YOLOX、A2J、CNN)を用い、エッジデバイス上でリアルタイムかつプライバシー保護された転倒検出を実現。マルチスレッド最適化によりフレームレートは4.5 FPS、分類精度は75.85%を達成した。
本論文は、多エージェントシミュレーションを用いて、英語の「go」の過去形「went」のような形態交替の出現と持続性を説明する。交替形式は音韻変化または語彙的変異から生じ、集団内の伝播動態を通じて広がる。生成された形態の現実性を評価するため、大規模言語モデル駆動のシステム「AI歴史言語学者」を導入し、実言語とシミュレーションの形態を比較する。結果は、スケールフリーな社会ネットワークとランダムなベルヌーイ採用がより妥当なパターンをもたらすことを示す。3つのケーススタディで実際の歴史的変化をモデル化している。
AfriSUDは、SUDフレームワークを用いた9つの多様なアフリカ言語の最初の大規模構文注釈付きツリーバンクコレクションです。モデル評価により、アフリカ言語の構文を捉える上で顕著な構文ギャップが明らかになりました。
潜在推論モデル(LRM)における観察可能なパターン(BFS的フロンティアやデコード可能な算術計算など)が、制御モデルでも出現し、必ずしも行動に因果的影響を与えないことが示された。因果的介入により、潜在思考の利用は段階的であり、幾何学的解析では効果が低ランク方向に集中することが明らかに。観察可能なパターンだけでは内部推論メカニズムの証拠とはならず、LRMの解釈可能性には適切な制御群と因果テストが必要である。
新たな研究では、アラビア語のソーシャルメディアテキストからメンタルヘルス障害を検出するために、MARBERTのドメイン適応版であるMentalMARBERTを提案しています。適応的事前学習と階層的ファインチューニングからなる2段階フレームワークを用いて、6カテゴリにわたる50,670件のツイートからなる新しいデータセットで、マクロF1=0.861、精度=0.877という最先端の性能を達成しました。
ショッピング推論ベンチマーク(Shopping Reasoning Bench)は、小売ドメインの専門家によって作成された新しいベンチマークであり、525のミッション(シングルターン232、マルチターン293)と10,863の重要度加重バイナリルーブリックで構成されています。嗜好の洗練、トレードオフ分析、互換性評価などのマルチターン推論能力を評価します。GPT、Claude、Geminiなどのトップモデルの評価では、全体的な合格率はわずか57~77%であり、マルチターンタスクでは大幅に低下し、専門家レベルのアドバイスにはまだギャップがあることを示しています。
本研究では、抽象的なペルシャのことわざを道徳的に忠実な物語に変換することを「制約付きセマンティックデコンプレッション」タスクと位置づけ、ペルシャのことわざに基づくストーリー生成用データセットPANDを紹介する。ハイブリッド評価フレームワークにより、現在のLLMは流暢なテキストを生成できるものの、ことわざに埋め込まれた道徳的・因果構造を忠実に具現化できない「デコンプレッションギャップ」が明らかになった。明示的な推論と反復的な改良がこのギャップを部分的に緩和する。
本論文では、メカニズムレベルの薬物間相互作用(DDI)予測のための再現可能なラベリング・評価プロトコルを提案する。7ファミリー147サブタイプの分類法とリークセーフなコールドスプリット戦略を特徴とする。また、シングルトークンKLダイバージェンス、PRM加重DPO、メカニズム認識検索チャネルという3つの訓練革新を組み合わせたMARD-7Bモデルを開発。2026年4月のDrugBankリリースにおいて、MARD-7Bは32システム中で薬物対の新規性下でも精度を維持した唯一のシステムであり、最良ベースラインを13.9ポイント、GPT-4oを6.7ポイント上回り、コストはフロンティアAPIの約1%である。反記憶化シグネチャは、モデルが稀な薬物でも精度を向上させることを示し、その利得は薬物頻度の記憶ではなく構造化された薬理学的推論に由来することを示唆している。