ナオミ・グレイトは、Meta(旧Facebook)で最長勤務の社員の一人で、入社初期から現在は製品責任者を務めています。彼女は、上司のザッカーバーグに対する見方、中小企業向けAIエージェントの可能性、そしてAIが雇用に与える影響について語りました。
AI ニュース速報
リアルタイム監視
最新ニュース
信頼できる情報源、出典、権限、サイト内閲覧を保ちながら、AI の変化を読める情報に圧縮します。
最新ニュース
SpaceXは個人投資家向けのIPOロードショービデオを公開し、CFOのBret Johnsen氏がロケット、Starlink、AI事業の連携を説明。Starlink、AIソリューション、宇宙データセンター、ポイントツーポイント旅行、小惑星採掘などの野心的な目標を強調し、粗利益率と純利益率の改善目標を示した。IPOの評価額は約1.77兆ドルで、6月11日に価格決定、ティッカーはSPCX。
ジェス・アサト議員の弁護士によると、Grok AIツールが作成した品位を傷つける性的な素材をめぐり、他の被害者も訴訟を検討している。
NVIDIAの創設者兼CEOのジェンスン・フアン氏が今週ソウルを訪れ、韓国のAIエコシステムのパートナーやビルダーと会談。AIサプライチェーン、ロボティクス、物理AIの機会に焦点を当てる。
新しい研究によれば、意識は行動だけで判断できない。哲学を語るチャットボットも蜜を探すミツバチも同様だ。研究者は脳やコンピュータの内部メカニズムに注目し、現在のAIには意識はないが、昆虫や未来の機械には可能性があるとしている。
大学の副学長がオーストラリアの主要紙に寄稿した意見記事でAIを使用したことを認め、事前に開示していなかったことが、AIの利用と信頼のギャップを浮き彫りにした。Roy Morganのデータによると、14歳以上のオーストラリア人の58%が毎月AIを利用している。
The Interceptの調査により、米軍がAI駆動のコンテンツサイト「La Tilde」を利用してラテンアメリカのユーザーにプロパガンダを流していることが判明。同サイトは現代的なメディアブランドに偽装しているが、実際は米特殊作戦コマンド南部分隊の心理作戦プラットフォームであり、コンテンツの多くはAI生成で、透明性に欠ける。
Nouriは、AIを活用した総合ウェルネスアプリで、瞬時の食品スキャン、パーソナライズされた食事プラン、適応型エクササイズプログラム、レストラン推薦を提供します。毎日のウェルネススコアを表示し、PWAとしてiPhoneとAndroidで利用できます。
この記事では、AI科学者エージェントを用いて神経科学の研究を加速するビジョンを探る。著者は、脳のアトラス、デジタルツインの構築、および実際の被験者による検証を組み合わせることで、研究効率を大幅に向上できると指摘する。また、資金提供者が優先すべきプロジェクトの種類についても提言している。
Appleの年次 Worldwide Developers Conference(WWDC)が6月8日から12日まで開催されます。注目は、Geminiを搭載した刷新されたSiri、iOS 27などの新OS、そしてAI写真編集ツールです。また、折りたたみiPhoneを含む「Ultra」シリーズの噂もありますが、ハードウェア発表は9月にずれ込む可能性があります。
本研究は、関節エンコーダのみを用いて足式ロボットの接触検出を行う自己教師あり表現学習フレームワークを提案する。力センサを必要とせず、従来の教師あり手法や確率ベースライン法より優れた性能を示し、コードを公開している。
FlowPROは、フローマッチング視覚-言語-行動(VLA)モデルのための報酬なしオフライン強化学習フレームワークを提案する。中核アルゴリズムRPROは、対照的最適化器と明示的近接正則化を組み合わせ、報酬ハッキングを排除する。遠隔操作による介入-ロールバックパラダイムでペア軌道を収集し、平滑補間とバッチ混合により密な状態監視を実現。4つの長時間双腕タスクで最高成功率を達成し、4つのベースラインを上回った。
本論文は、ニューラル常微分方程式(ODE)を用いてリーマン多様体上でデモンストレーションから学習(LfD)する新しい手法を提案する。従来のLfDはユークリッド空間で行われるが、ロボットの状態(例えば姿勢)は曲がった空間上で自然に変化する。提案手法はニューラルODEにより測地線を効率的に推定し、多様体上の任意の2点間の自然な運動生成を実現し、測地線をタスク空間にデコードしてロボットに実装する。シミュレーション実験によりフレームワークの有効性を検証している。
MoDexは、既に保持している物体を解放せずに、1つの器用なハンドで複数の物体を順次把持するための拡散ポリシーです。対掌空間と点群に条件付けられ、現在の把持には一部の自由度のみを使用し、残りは後続の把持のために確保します。模倣学習と強化学習の2段階トレーニングにより成功率が向上。シミュレーションで2.92-17.92%、実世界で6.67-17.78%の改善を達成。
VASOは、形式検証を用いてLLM生成ロボットスキル契約の自己進化を導くフレームワークです。Clearpath JackalおよびPX4クアッドコプタータスクにおいて、100サンプル未満の最適化で97.2%の形式仕様準拠を達成し、実行フィードバック、プロンプト最適化、ファインチューニングベースラインを上回ります。形式検証と自己進化スキルを閉ループ化した最初のフレームワークです。
ロボット制御における経路追従問題に対し、リー群上の点と曲線の距離を効率的に計算する手法を提案。曲線をG-多項式で表現し、その構造を利用して多項式求根問題に帰着させることで、計算時間を大幅に削減しつつ精度を維持する。SE(3)群に対する実用的な公式を提供し、ロボットアームで実験検証。計算パッケージはオープンソース。
研究者らは、より低いハードウェアコストでより広い作業空間を実現する新しい4セグメント8ジョイントの四元数ジョイントケーブル駆動冗長マニピュレータ構成を提案した。残差強化学習は、位置および方向の精度において最先端のFABRIKアルゴリズムを3桁上回り、より簡単な制御実装を可能にする。この研究は、この種のマニピュレータと制御システムの設計に新たなツールを提供する。
外骨格制御をオンラインでパーソナライズするOLIVEフレームワークを提案。低ランク残差分解により更新コストを削減し、EMG、IMU、振動センサーのみを使用。動的ランクスケジューラで地形に応じた適応を実現し、歩行の滑らかさ、労力低減、安定性でベースラインを上回る。
本研究は、OCT/OCTAデータを用いて加齢黄斑変性(AMD)の重症度を自動分類する深層学習モデルを開発した。271名の参加者において、バイオマーカーマップ、2D en face投影、3Dボリュームの3つのモデルを評価。すべてのモデルが良好な性能を示し、バイオマーカーベースモデルが最高の総合性能(QWK=0.85)を達成し、特に早期AMD検出に優れていた。
深層学習ベースのアルゴリズムで、単一のOCTAボリュームから毛細血管の解剖学的構造を復元し、画像品質を大幅に改善。初めて3次元血管構造に着目。
Biomazonは、アマゾン盆地をカバーする20m解像度のマルチモーダルベンチマークデータセットであり、GEDI RHおよびAGBDターゲットをマルチセンサー予測因子と組み合わせ、完全なGEDI RHプロファイルと地上部バイオマス密度を共同予測するためのものです。標準化された空間分割と評価プロトコルを提供し、バックボーンモデルスケール、モダリティ寄与、補助埋め込みに関する包括的なアブレーション研究を実施しています。Biomazonは、熱帯林における構造的に一貫したRHプロファイル予測と構造-バイオマスモデリングのためのリファレンスベンチマークを確立します。
本論文では、物理ガイド付き再構築フレームワークRePHOを提案し、単眼ビデオから物理的に妥当な人物-物体インタラクションを復元する。運動学推定から開始し、強化学習ポリシーを物理シミュレータで最適化し、ノイズの多い推定を処理する適応サンプリング戦略を用いる。2つのベンチマークで物理的妥当性の指標が大幅に向上した。
本論文では、リソース制約のある環境での網膜血管セグメンテーションのために設計された、わずか75Kパラメータの効率的なニューラルネットワークLightVesselNetを提案する。コンパクトなエンコーダ-デコーダアーキテクチャにチャネルおよび空間アテンションメカニズム、ボトルネックでのマルチスケール特徴集約モジュール、デコーダでのサブピクセルアップサンプリング戦略を採用。専用のエッジ残差接続により、デコード全体で微細な血管の詳細を保持。DRIVE、STARE、CHASEDB1、FIVES、HRFの5つの公開データセットでの広範な実験により、感度スコアはそれぞれ0.8189、0.8499、0.8640、0.8634、0.8096、Dice係数は0.8070、0.8072、0.8181、0.8649、0.7686を達成。最先端モデルと比較して効率が向上。クロスデータセット評価により汎化能力を確認。全体として、低リソースの臨床環境やモバイルスクリーニングツールへの展開に有望な候補。
本論文では、異なる撮像装置間でのマイボーム腺セグメンテーションのための2段階フレームワークTopoPult-SSLを提案する。第1段階では対象の腺マスクを必要とせず、眼瞼輪郭と臨床メタデータを弱い事前情報として利用する。第2段階では、対象腺マスクが利用可能な場合、教師付き自己蒸留により相補的な複数教師を単一のコンパクトな生徒モデルに集約する。MGD-1kからCAMGベンチマークにおいて、蒸留モデルはDice 0.716を達成し、UA-MTやアンサンブル教師を単一パスで上回った。腺マスク不要の変種は精度0.694を達成し、SAM/MedSAMを大幅に凌駕した。
研究者らは、ソースLLMからターゲットの画像/動画生成器へ、軽量なアライメントを介して安全方向を転送するクロスモデル安全ステアリングフレームワークを提案。ターゲット側の不安全データを必要とせず、安全性向上と生成品質の維持を両立する。
本研究は、パーソナルカメラロールの視覚的質問応答(VQA)設定を提案し、50人のユーザー、31,476枚の画像、2,500のQAペアからなるcamrollデータセットを構築し、階層的メモリと効率的なナビゲーションツールを備えたcamroll-agent会話型AIエージェントを設計しました。実験では、camroll-agentが複数のベースラインを上回り、パーソナルな視覚記憶には標準的なテキスト記憶とは異なるアプローチが必要であることを示しています。
静的フォントを自動的に可変フォントに変換する新しい手法NIVは、ニューラルネットワークを用いて各点の変位を予測し、ウェイトや幅などのデザイン軸に沿った連続的な変化を可能にする。このモデルは未知のスタイルや複雑な字形(CJK文字を含む)にも汎化し、標準的な可変フォントファイルを出力する。
研究者らは、知識と推論を必要とする動画理解を強化するために設計された最初の大規模トレーニングコーパス「VideoKR」を発表した。これは、31万5千の動画推論例と、新たに収集された14万5千のCCライセンス付き専門分野動画で構成される。人間参加型のスキル指向の例生成パイプラインを開発し、新しい専門家注釈ベンチマークVideoKR-Evalも作成した。実験では、標準のSFT→GRPOパイプラインの下で、VideoKRで事後学習されたモデルは知識集約型動画推論で以前のアプローチを上回り、一般的な動画推論でも競争力を維持した。
LANTERNは、ゼロLLMコールで低レイテンシのハイブリッド検索により、会話履歴圧縮後に詳細を復元する軽量メモリ層です。実験では、LANTERNが失われた事実の回復においてMemGPTを上回り、汎用LLMの精度を平均8.4パーセントポイント向上させました。
本論文では、自然言語推論(NLI)タスクのための新しい多粒度推論ネットワーク(MGRN)を提案する。この手法は、階層的な意味特徴を明示的に活用し、語彙マッチングから論理的推論に至る人間の認知プロセスを模倣することで、複雑な意味関係を捉える。実験により、MGRNは複数のベンチマークで強力なベースラインモデルを一貫して上回ることを示している。