LayerProof が Bristol を発表。ファイルをドロップし、チャットでレポートを整形し、ワンクリックでライブWebページとして公開できる AI 搭載ツール。エージェンシー、フリーランス、コンサルタント向け。
AI ニュース速報
リアルタイム監視
最新ニュース
信頼できる情報源、出典、権限、サイト内閲覧を保ちながら、AI の変化を読める情報に圧縮します。
最新ニュース
ボストン・グローブ紙の2026年「テック・パワー・プレーヤーズ」リストに8名のMIT関係者が選出。記事は、MITがAI、起業家精神、エネルギー、量子技術などの分野でリーダーシップを発揮し、マサチューセッツ州を技術革新の中心に位置づけていることを強調している。
本論文は、精密視覚検査のためのリアルタイム閉ループロボット姿勢制御パイプラインを提案する。アドミッタンスベースのフレームワークを用いて、オペレータの入力と知覚駆動の表面位置合わせを統合する。エンドエフェクタを粘性媒体中を動く仮想球体としてモデル化し、質量-ダンパシステムによるコンプライアント動作を実現。6自由度マニピュレータで検証し、平均姿勢誤差0.4°を達成した。
本研究では、4つの行動空間(姿勢増分、姿勢速度、関節位置増分、関節速度)を視覚ベースの把持と押し出しタスクで評価。シミュレーションで訓練し、シミュレーションから実世界への転移により、関節速度行動空間が滑らかさとタスク成功率で最適であることを示し、行動空間選択の実用的なガイダンスを提供する。
DREAM-Chunkは、軽量な潜在世界モデルを用いてチャンキングベースのポリシーを拡張するテスト時スケーリング手法であり、ポリシーの追加微調整を必要としない。テスト時に複数の候補アクションチャンクをサンプリングし、予測された潜在的な未来をロールアウトして、実際の状態と最も一致するチャンクからアクションを選択することで、確率的なダイナミクス下でのロバスト性を向上させる。Kinetixベンチマークと複数のロボットプラットフォームで検証された。
本論文は、動的で混雑した環境におけるマルチエージェントシステムに対して、凸集合グラフ(GCS)による軌道最適化とコンセンサスベースバンドルアルゴリズム(CBBA)による分散タスク割り当てを組み合わせた解決策を提案する。GCSは3D+時間の構成空間で最適軌道を求め、CBBAはタスク割り当てを調整し、衝突回避と正確な時間推定を実現する。静的・動的タスクを含むシミュレーション環境で有効性を確認した。
本論文では、強化学習を統合したニューラル組合せ最適化フレームワークN(CO)$^2$を提案し、手動ヒューリスティックを用いずに確率的オリエンテーリング問題を解く。多様なインスタンスに対して良好な汎化性能を示し、最先端の混合整数線形計画法と同等の性能を達成する。
VEGAは、ラベルなしの自己中心ナビゲーション映像からナビゲーション視覚言語行動(VLA)モデルを訓練する手法。単眼映像からシーン幾何を再構築し、障害物回避軌道を生成することで、幾何認識計画を視覚ベースのポリシーに蒸留する。VEGA-Benchは25万シーンと約500万のナビゲーション目標を含み、衝突削減と障害物回避でベースラインを大幅に上回る。
PAIWorldは、幾何認識型クロスビューアテンション、幾何ロータリーポジション埋め込み、潜在3D-REPA蒸留を備えた拡散トランスフォーマーフレームワークを導入し、ロボット操作におけるマルチビュー3D一貫性を実現し、WorldArenaリーダーボードで1位、AgiBot-Challenge2026で2位を獲得しました。
Guavaは、エージェントのワークフロー、アクション空間、観測空間の設計空間を系統的に探求し、反復的な知覚-推論-行動ループ、意味論的な行動抽象化、マルチモーダル観測の3つの重要な要素を特定した身体的操作フレームワークです。シミュレーションで収集した2000未満の軌跡を用いて、4Bパラメータのオープンソースモデルに身体的操作能力を蒸留し、最先端の専有モデルに匹敵する性能と強い汎化能力を示しました。
本論文では、失敗からの回復経験から状態抽象(関係述語)を段階的に発見・洗練し、スキルと概念を同時に学習するReSYNC手法を提案。シミュレーション4領域でベースラインを50%以上上回り、実世界ロボット操作への転送も成功した。
大規模言語モデル(LLM)は臨床テキストタスクに使用されているが、診断不確実性の表現を正しく保持できていない。本研究は1,200の臨床文書と9,184の不確実性注釈からなるベンチマークを構築し、3つのLLMを評価。結果、元の不確実性手がかりを半分未満しか保持できず、隣接するレベルの微妙な区別に苦戦することが明らかになった。
モントリオール強制アライナー(MFA)は2016年のリリース以来、研究と産業で最も広く使われる強制アライメントツールとなっています。最新バージョンMFA 3.0は、英語、日本語、韓国語のベンチマークで最先端またはそれに近い性能を達成し、平均境界誤差は15ミリ秒未満です。本稿ではMFA 1.0から3.0への発展、技術的改善、および言語間適応能力について詳述します。
多言語大規模言語モデルにおける数学関連パラメータが言語間で部分的に重複しており、英語が最大のパラメータセットを持つことが、横断言語メカニズム分析により明らかになった。
VISUALSKILLは、視覚的な図をスキル成果物に組み込んだ階層型マルチモーダルスキルライブラリであり、コンピュータ使用エージェントの長期タスクや未知のソフトウェアでの性能を大幅に向上させる。CUA-WorldとOSExpert-Evalのベンチマークで、VISUALSKILLを使用したClaude Code CLIエージェントは平均スコア0.456を達成し、スキルなしベースラインから15.3ポイント、テキストのみのスキルから8.3ポイントの改善を示した。
JetFlowは、1回のフォワードドラフト効率とブランチ単位の因果条件付けを組み合わせたヘッドベースの投機的デコーディングフレームワークであり、より大きなドラフト予算をより長い受け入れプレフィックスと高いエンドツーエンドの高速化に変換する。Qwen3モデルを用いたテストでは、MATH-500で最大9.64倍、会話タスクで4.58倍の高速化を達成。
本研究では、低リソース言語の合成データ生成における代替手法としてアクティベーションsteeringを提案し、言語steeringと品質steeringの2つの戦略を検証。4つのオープンソースLLMと11言語での実験により、初期層でのsteeringがデータの多様性と下流タスク性能を向上させることを示した。
SproutRAGは、学習された文間注意を用いて二分木チャンキングを構築し、コストのかかるLLM呼び出しや損失を伴う要約なしにマルチグラニュラリティ検索を実現する新しい階層型RAGフレームワークです。4つのベンチマークで情報効率を平均6.1%改善しました。
教育対話は貴重だがセンシティブなリソースである。既存のアプローチはガバナンスと精度のトレードオフを強いる。本論文では、匿名化をオープンエンドなエンティティ認識から制約付きプライバシートリアージへと再定義する完全ローカルカスケードフレームワークを提案する。再現率優先の結合提案器が候補スパンを過剰生成し、文脈認識レビューアが二値の編集/保持決定を行う。数学指導トランスクリプトにおいて、最強のローカル構成はマクロF1 0.958を達成し、LLMのみのベースラインや商用APIを上回り、完全に単一のラップトップで動作する。
CoATは、大規模音声言語モデルに連続潜在ワークスペースを導入し、エキスパート蒸留により音響情報を保持し、追加のデコードコストなしで性能を向上させます。
SAGEは、大規模言語モデルの忘却プロセスによって生じた保持能力の低下を修復するポストホック手法である。保持プロキシから支配的な活性化幾何を抽出し、閉形式の最適化問題を解くことで、高エネルギーの保持方向と整合する更新成分を抑制しつつ、忘却キャリアを維持する。複数の忘却手法とモデル規模での実験により、一貫した保持性能の改善が確認された。
TRIDENTは、ハイブリッド離散連続行動、安全性制約、物理ダイナミクスの三者結合に対処する新しいMARLフレームワークです。Richardson-Romberg勾配補正、Lyapunov制約付き逐次信頼領域更新、物理情報残差批評家を導入し、O~(1/√K)の収束率を達成し、ベースラインと比較して95.5%の訓練違反を削減します。
DRIFTは、標準的な影響関数の近接ギャップと勾配ノルムバイアスに対処するため、オンポリシー影響関数を使用して教師ありファインチューニングデータを洗練する新しい手法を提案する。データ分布を改善してLLMの能力上限を引き上げ、7Bパラメータモデルで一貫した改善を達成する。
本論文では、混合エキスパート(MoE)モデル向けの構造的プルーニングフレームワークを提案する。プルーニング比率割り当てをチャネルスコアのカバレッジ最大化問題として再定式化し、アトリベーションベースの近似で効率的に解決する。DeepSeekおよびQwen MoEモデルでの実験により、50%または25%の構造的プルーニングと4ビット量子化を組み合わせても精度を維持し、Qwen3-30B-A3Bで5.27倍のメモリ削減を達成、既存手法を上回る。
本論文は、微分幾何学、リー群論、流体力学を活用し、衝撃波理論と確率的勾配降下法の対称性商学習ダイナミクスの間の数学的に明示的な関連性を確立する。パラメータ対称性を商し、局所エントロピー粗視化を適用した後、有効ダイナミクスは商多様体上の粘性ハミルトン-ヤコビ方程式を満たす。さらに、生のパラメータダイナミクスが商空間上の勾配場で要約できると仮定すると、粗視化損失関数の勾配はバーガース型方程式に従い、衝撃形成を厳密に証明できる。この理論は多層パーセプトロン、畳み込みニューラルネットワーク、Transformer、平均場ネットワークに適用され、それらがハミルトン-ヤコビまたはバーガース型方程式に従うことを示す。著者は、この枠組みが深層学習の実用的診断法をもたらすと推測する。Transformerなどのアーキテクチャでは、生のパラメータノルムは対称性冗長性により歪められることが多いが、対称性補正された商可観測量は訓練フェーズ遷移の監視、予測、制御のための原理的な基盤を提供する。
Artemisは、各脳領域に独立に介入し、領域固有の交絡因子表現を学習することで、加齢や性別などの人口統計学的要因による交絡を除去し、脳疾患診断や分類におけるGNNのロバスト性と解釈可能性を向上させる領域レベル因果フレームワークである。
CODEBLOCKは、コード用大規模言語モデルの微調整のための構造認識型スパース監視フレームワークです。孤立したトークンではなく構造的に完全なコードブロックを選択し、6つのベンチマークで平均pass@1を向上させ、監視トークンはわずか1.9%しか使用しません。
強化学習におけるエージェントの能力向上に伴い、固定タスク分布は飽和し、単純な合成生成では無効または簡単すぎるタスクが生じる。PROPELフレームワークは、軽量な活性化プローブを用いてソルバーの成功率を予測し、直接評価を回避することで、学習可能フロンティアに位置するタスクを効率的に生成する。数学、コード、ソフトウェア工学の各領域で、目標成功率でのタスク生成割合が大幅に向上した。
ガウス混合注意(GMA)は、K個の学習されたガウス混合成分を介したルーティングにより、標準的なO(N²)の代わりにO(NK)のメモリスケーリングを実現する新しい注意機構です。実験では、GMAは長文脈分類タスクで注意ベースラインと競合し、因果GMAはWikiText-103で線形/ランダム特徴注意を上回りますが、最適化された因果SDPAやMambaには及びません。GMAは確率的で解釈可能な固定K線形時間注意の代替手段を提供します。
ProfiLLMは、ライドヘイリングディスパッチのためにユーティリティ調整されたユーザープロファイルを作成するエージェント型LLMデータパイプラインです。ツール拡張グローバル知識マイニングとユーティリティ調整プロファイル探索を使用してスケーリングの課題を克服します。DiDiに導入され、予測AUC、GMV、完了率の大幅な改善を達成しました。