GLM-5.2 が全員の雰囲気チェックを通過したことで、オープンモデルの物語はついに本物のフロンティアストーリーとなった。
AI ニュース速報
リアルタイム監視
最新ニュース
信頼できる情報源、出典、権限、サイト内閲覧を保ちながら、AI の変化を読める情報に圧縮します。
最新ニュース
Mutter AI Dictation は Mac 向けアプリで、プライバシーを重視したディクテーションと、口頭での乱雑な考えを完成された文章に変換するインテントモードを提供し、タイピングの約3倍の速さを実現します。
本記事の著者は、Replitのような「バイブコーディング」スタートアップが、TikTokの広告を通じて非プログラマーに簡単なアプリ開発と富を約束するマーケティングを行っていると指摘。これはマルチレベルマーケティング(MLM)や暗号通貨詐欺に似ており、実際のコストやリスクを隠蔽し、経済的に厳しい状況にある若者を食い物にしていると批判する。
Plansera AI は、AI が作成する E-2 ビザの事業計画書を提供し、起業家が必要な書類を迅速に準備するのを支援します。
ボストン小児病院とOpenAIの共同研究により、AIツールを使ってこれまで診断がつかなかった18人の希少疾患の子どもたちが診断された。この研究はNEJM AIに掲載され、ゲノム解析におけるAIの可能性を示している。
バレット・ゾフ(Barret Zoph)がOpenAIに復帰してわずか5ヶ月で再び退社したことが、The Vergeの取材で明らかになりました。彼は1月中旬に復帰し、エンタープライズAI販売を担当していました。以前はミラ・ムラティ(Mira Murati)のThinking Machines Labで共同創業者兼CTOを務めていましたが、不適切な関係の疑惑により同社を離れていました。OpenAIは退社を確認しています。
国民の多くがAIの進行速度は速すぎると感じる一方、多くの政治家はAI導入の加速を求めている。本稿では、この矛盾の政治的・経済的理由を探り、急激な変化がもたらす社会的混乱について考察する。
SakhaはSlack上で動作するAIオンボーディングアシスタントで、新入社員を日々のフローでガイドし、企業ナレッジベースから質問に回答し、契約書をレビューし、ポリシーを生成します。従来のオンボーディングプロセスの問題を解決するために、定額料金モデルを提供します。
Ferrix AIは、プロダクトマネージャー向けに12の専門AIエージェント群を発表。カスタマーフィードバック収集からローンチ後モニタリングまで、製品ライフサイクル全体をカバーし、校正された自律性で反復作業を自動化しつつ、PMが重要な決定をコントロールできるようにする。
FetchSandboxは、API統合テスト中に発生した障害を自動的に記録し、開発者が問題を迅速に特定・修正できるようにするツールです。
OALABSの研究者によると、低スキルの攻撃者がAIエージェントClaude CodeとCodexを使用し、曖昧なプロンプトでガードレールを回避し、少なくとも14社に侵入してデータを窃取した。攻撃者の運用セキュリティの失敗により1000以上のセッションログが回収され、身元と手法が明らかになった。
SCAN-Plannerは四足ロボット向けの空間衝突認識ローカルプランニングフレームワークで、ヨー認識ツインシリンダーフットプリントモデルと投影A*探索を活用し、狭い通路、散らかった室内、大規模3D非構造化環境を安全かつ効率的にナビゲートします。
本研究では、カテゴリー理論と層理論を用いた新しい多層数学モデルを提案し、自律エージェントシステムのためのソフトウェアコンポーネントアンサンブル言語(SCEL)を記述する。このモデルでは、コンポーネントを点、アンサンブルを開集合、分散知識を層のデータとして扱う。情報共有は局所データの「接着」としてモデル化され、システム障害は層コホモロジーによって位相的障害として定量化される。このアプローチは、複雑な分散システムの検証を幾何学的解析に変換し、堅牢な自律システム設計のための構造的洞察を提供する。
本論文は、非慣性地面上で動作するヒューマノイドロボットが、固有受容センサーのみを使用してリアルタイムに状態推定を行うための不変拡張カルマンフィルタリング(InEKF)アプローチを提案する。足に取り付けたIMUを利用し、地面の動きを直接測定することなく、移動地面に対するロボットの位置と速度を推定する。実験では、振動する地面上で収束速度が96%向上し、位置推定誤差が80%削減された。回転地面上での歩行では、平均推定誤差が9cm未満である。
本論文では、具現化されたコーディングエージェントが自己主導の遊びを継続的なスキル学習段階として利用する「遊び心のあるエージェントロボット学習」を提案する。RATsフレームワークは遊びの中で探索的タスクを提案し、コードポリシーを実行、進捗を検証し、成功した実行を永続的なスキルライブラリに抽出する。実験ではLIBERO-PROとMolmoSpacesで大幅な改善を示し、スキルは微調整なしで転用可能である。
本論文はDiffusionVSを提案する。これは拡散ポリシーに基づくビジュアルサーボ手法で、条件付きノイズ除去によりカメラ速度を生成し、オンライン学習で汎化能力を向上させる。シミュレーションでは成功率ほぼ100%、物理実験では93%を達成し、既存のビジュアルサーボネットワークに統合して性能を向上させることができる。
3Dシーングラフ(3DSG)は、幾何学的根拠と意味的・関係的抽象化を組み合わせた空間AIの強力な表現として登場し、ロボティクスやコンピュータビジョンにおける操作、ナビゲーション、タスク計画、シーン理解など幅広い問題に関連しています。しかし、この分野は断片化しており、異なるコミュニティが異なる定式化、構築パイプライン、評価プロトコルを採用しているため、手法の比較、共通の仮定の特定、実世界展開の課題の評価が困難です。本サーベイは、3DSGの統一された批判的レビューを提供し、特に未解決の課題と将来の方向性に焦点を当てています。ノード・エッジ属性、階層構造、動的シーン表現、アフォーダンス対応拡張などのモデリング選択を分析し、センサデータからの構築方法、下流アプリケーション、評価戦略を考察します。
WorkBenchMarkは、RoboCupスマートマニュファクチャリングリーグに触発されたLEGO Duploベースのロボット組立ベンチマークです。400のタスクを4つの複雑度レベルで提供し、オープンボキャブラリ認識と「分解による組立」ベースラインソリューションを提案します。計画ベースのパイプラインは、すべてのレベルで最新の視覚-言語-行動アプローチを上回ります。ベンチマーク、シミュレーション環境、ベースライン実装はオープンに公開されます。
研究者らは、Atari CX40+コントローラーを物理的に操作するロボット「Robotroller」と、Arcade Learning Environmentからのゲームフレームと報酬信号を画面に表示するデバイス「Atari Devbox」を開発した。これらの装置と市販のカメラ、デスクトップコンピュータを組み合わせたシステム「Physical Atari」は、現実世界での強化学習アルゴリズムの研究を可能にする。システムは堅牢性(すべての動作をベアリングで行い、サーボ状態を高頻度で監視するソフトウェア)とアクセス性(安価な市販部品と3Dプリンターで製造可能な部品を使用)を重視して設計されており、総コストは1,000ドル未満で、数週間の連続実験に耐えうる。実験では、強化学習アルゴリズムがロボット上で直接学習できることを確認し、学習時と展開時のわずかな分布のずれがポリシーのパフォーマンスを著しく低下させることを示した。この結果は、ロボット上での強力なパフォーマンスにはデバイス上での適応が重要であることを強調している。
研究者は拡散モデルを用いたビデオの同時動作・位置編集のためのワンショットフレームワークTeleMorpherを提案する。この手法は主人公と背景を分離し、動作事前分布を用いたポーズワーピングと新しい評価指標を導入する。実験では、実世界のビデオとTaiChiデータセットで優れた性能を示した。
本論文は、多表現拡散モデルにおける非同期ノイズ除去スケジュールを学習する手法を提案する。スケジュール補正目的関数と凸で単調なパラメータ化を導入し、追加計算量1%未満で学習する。ImageNet 256x256で、200エポックでFID 1.05(800エポックのベースラインと同等)、600エポックでFID 1.02(10億パラメータモデルを上回る)。非誘導設定でも大幅な改善。
GB-LSRは、固定グリッドの局所スペクトル表現を用いて連続画像再構成を行う手法です。単一の訓練可能なグローバルバンド幅をすべてのパッチで共有することで、モデルを簡素化し計算コストを削減します。標準的なネイティブ再構成ベンチマークでは、LIIF、LTE、WIREなどの手法と比較してPSNRが2.8-3.6 dB向上し、推論コストは最も遅いベースラインの4分の1です。超解像タスクでは、4倍スケールでLIIF-RDNの1.44倍、LTE-SwinIRの3.25倍の速度を実現しています。また、局所アンサンブル平均を省略したバリアントは、PSNRの低下を無視できるレベルに抑えつつ、1.77倍の高速化と35%のメモリ削減を達成しています。
言語指示による視覚埋め込み(LIVE)は、言語を高レベルのガイダンスとして利用し、推論時にタスク中心の埋め込みを生成します。これにより、タスク固有の再トレーニングが不要になります。MMVPで視覚的幻覚を34ポイント削減し、視覚質問応答では桁違いに多くのパラメータを持つモデルを上回り、未見の指示やタスクにも汎化します。
Mix-QVLAは、視覚-言語-行動(VLA)モデル向けのタスク証拠認識型混合精度後訓練量子化フレームワークです。量子化がタスク関連の証拠を保持するか評価し、各層の精度を動的に調整することで、高精度を維持しながらメモリ使用量を大幅に削減し、推論速度を向上させます。LIBEROベンチマークでは、メモリを15.4GBから4.1GBに削減、成功率96.3%(BF16比97.1%)、推論速度1.52倍を達成しました。
本論文では、効率的な並列領域認識に最適化されたマルチモーダル拡散言語モデルPerceptionDLMを提案する。拡散言語モデルの並列デコード特性を活用し、効率的なプロンプティングと構造化アテンションマスキングにより、複数のマスク領域を同時に認識し、推論効率を大幅に向上させる。さらに、並列領域記述能力を評価するためのベンチマークParaDLC-Benchを構築。実験では、競争力のある性能を維持しながら、マルチ領域認識タスクの速度を大幅に改善した。
最新のアプローチImageWAMは、ロボットの行動予測にビデオ生成の代わりに画像編集を利用し、優れた性能と大幅な計算コスト削減を実現します。
LooseControlVideoは、スパースな指向性3Dボックスを「ブロッキング」プロキシとして使用し、直感的で表現力豊かなテキストからビデオ生成制御を実現する新しいフレームワークです。Wan 2.2バックボーンを微調整し、DNOCSエンコーディングで3Dサイズ、方向、深度順オクルージョンを処理し、グローバルコンテキストを乱さずに局所的な改良を可能にします。nuScenes、HO-3D、BEHAVEベンチマークでの評価では、軌跡誤差が1.2〜3倍改善、剛体運動一貫性が2倍向上、オクルージョン精度が1.5〜2倍向上し、既存手法を大幅に上回りました。
LEAPは、Vision Transformer(ViT)の特徴ベース知識蒸留のためのトレーニングカリキュラムであり、教師の中間特徴マップを徐々に難しい目標として利用し、学生が高レベルの抽象化に取り組む前に基礎表現を構築できるようにします。実験では、ImageNet-100でViT-Sが90.1%の精度を達成し、12.24%の改善を示し、ImageNet-1Kのインスタンス検索タスクで3.84%と7.75%の改善、さらにトレーニングFLOPsと時間をそれぞれ25.1%と21%削減しました。
研究者らは、胸部X線画像合成のための初の10億パラメータ規模の生成基盤モデルを発表。13億以上のパラメータを持ち、120万枚のX線画像と臨床専門家によるメタデータで1.6兆トークンを学習。人口統計、撮影ビュー、10種類以上の病変にわたる制御可能な生成と編集を実現し、合成画像は臨床専門家が本物と区別できないほど高品質。
本論文は、ベイズ的視点とメカニズム的解釈可能性に基づく自己関数ベクトルを導入し、インコンテキスト学習(ICL)のアレアトリック不確実性を直接推定する手法を提案する。さらに、アレアトリックとエピステミック不確実性を分離するための初の厳密な評価プロトコルを設計。実験では、既存手法よりも信頼性高くLLM予測の不確実性を測定でき、幻覚検出などの信頼性応用に有用であることを示す。ACL 2026に採択。