AI News HubLIVE
サイト内リライト1 分で読了

なぜビデオエージェントモデルが次の一手か — Ethan He、xAI Grok Imagine

xAI内部:3ヶ月でGrok Imagineを構築、ビデオ生成とワールドモデルの比較、そしてGrok Imagineが過小評価されている理由。

ソースLatent Space

最近、xAIの元メンバーであるEthan HeがLatent Spaceのポッドキャストで、Grok Imagineの構築経験を共有しました。彼はNVIDIAのCosmosワールドモデルからxAIに移り、3ヶ月で少人数チームでGrok Imagineをゼロから構築しました。Ethanは、ビデオモデルの能力は主に言語モデルから得られ、ビデオデータだけに依存するものではないと強調。彼は、ビデオ生成の将来はビデオエージェントであり、AIコーディングのようにマルチターンの推論と計画が可能になると考えています。また、迅速な反復とデータパイプラインの小さなバグ修正が新しいアルゴリズムよりも重要だと述べました。さらに、ビデオモデル訓練のコスト、オーディオ-ビデオアライメントの課題、ワールドモデルの定義について議論しました。最後に、Ethanはビデオエージェントが来年のトレンドになると予測し、生成UIが従来のHTML/CSSを置き換える可能性について語りました。