アレン人工知能研究所(Ai2)は、視覚言語モデルMolmoシリーズの新たな拡張として、MolmoPointとMolmoWebを発表しました。これらは、Molmoの能力を単なる視覚理解から実際の操作や行動へと拡張するものです。この取り組みは、オープンなAI開発へのAi2のコミットメントを継続し、研究者や開発者が検査、適応、再現、そして改良できるモデルを提供します。
MolmoPointの革新は、ポインティングをクロスモーダルな問題として捉え直したことにあります。従来のモデルがテキスト座標を生成する間接的な手法をとっていたのに対し、MolmoPointはモデルが見ている入力データから直接ポイントを選択します。まず大まかな領域を選び、次に正確な位置に絞り込みます。このアプローチにより、特に高解像度やボタンやメニューが密集したUIにおいて、精度と効率が飛躍的に向上しました。ベンチマークでは、ポインティング、画面要素識別、物体追跡の各タスクでオープンモデルとして最高性能を達成し、研究者自身も驚くほどの改善を示しました。
もう一つの発表であるMolmoWebは、マルチモーダルなウェブエージェントのスイートです。ユーザーからの指示とスクリーンショットを受け取り、HTMLやアクセシビリティツリーに依存せず、視覚情報のみから次のブラウザアクションを予測します。この設計により、ウェブサイトの変更に対して堅牢で、テキスト処理よりも低コストです。MolmoWebは、主要なウェブブラウジングベンチマークにおいて同等規模のオープンモデルを凌駕し、より大きなパラメータを持つGPT-4oベースのエージェントをも上回る性能を示しました。
開発プロセスは容易ではありませんでした。チームは2025年に、20のウェブサイトで各5〜10のテンプレートタスクを処理するエージェントを構築するという暫定目標を設定しました。2026年初頭には、トレーニングデータの拡大と評価の堅牢性向上に注力しました。Gupta氏によれば、エージェント研究では評価が特に困難で、単一の失敗が後の行動全体に影響を及ぼす可能性があるため、多くの時間を費やして軌跡の可視化とデータ生成・トレーニング・評価間の矛盾の追跡を行いました。
Ai2は、モデルチェックポイント、トレーニングデータ(最大規模の公開人間ウェブタスクデモンストレーションを含む)、および統一評価ツールを公開しています。これにより、コミュニティは研究を再現し、改良を加えることができます。Gupta氏は「当社の北極星は、人々が人間にしかできないことに集中できるようにするデジタルアシスタントです」と述べています。
MolmoPointとMolmoWebは、異なる次元で同じ問題に取り組んでいます:モデルが認識したものを理解し行動できるようにすることです。MolmoPointはポインティングをより正確にし、MolmoWebは画面上の情報を利用してウェブをナビゲートします。両者はMolmo 2を基盤とし、同じオープンな開発哲学を共有しています。すでにロボット工学向けのMolmoBotやMolmoSpaces、3D知覚用のWildDet3Dとともに、Molmoエコシステムはポインティング、ウェブ操作、3D認識、物理操作をカバーしています。すべてのコンポーネントはオープンソースであり、大学の研究室や個人開発者がベンダー依存なしにカスタマイズや構築を行えます。これにより、視覚知能の進歩がアクセス権によって制限されず、誰からでも次のブレークスルーが生まれることを目指しています。