Perceptron AI は2025年11月26日、わずか20億パラメータのオープンウェイト視覚言語モデル(VLM)「Isaac 0.1」をリリースしました。このモデルは、実世界の知覚タスクに特化して設計されており、画像に関する質問への回答、空間関係の推論、雑然とした環境でのテキスト読み取り、さらに回答の根拠の提示が可能です。Isaac 0.1はReplicateプラットフォーム上で動作し、開発者はAPIを通じて簡単に利用できます。
20億パラメータという小規模ながら、IsaacはOCR(光学文字認識)、物体認識、視覚推論の各タスクにおいて、はるかに大規模なモデルに匹敵する性能を発揮します。例えば、複雑なシーン中の文字読み取り、散乱した物体の識別、物体間の空間関係の理解において、Isaacは優れた能力を示します。
Isaac 0.1の核となる特徴は、説明可能な視覚推論です。従来の視覚言語モデルは単に答えを返すだけでしたが、Isaacはシーンを説明するだけでなく、その答えが正しい理由を明示できます。具体的には、各主張に関連するバウンディングボックスや領域を返すことで、透明性とトレーサビリティを提供します。これは、医療画像分析、自動運転、工業品質検査など、段階的な証拠が求められるアプリケーションの構築に不可欠です。
OCRに関しては、Isaacは標識、ラベル、包装、文書上の小さな文字や部分的に隠れたテキストを読み取るために特別に最適化されています。また、文脈理解と組み合わせることで、「返送先はどこですか?」や「試合の残り時間は?」といった、文字とシーンの理解を必要とする質問に答えることができます。これにより、文書処理、小売、製造業での実用性が高まります。
空間認識もIsaacの重要な強みです。モデルは物体間の方位関係(左/右、上/下など)、相互作用(覆う、接続するなど)、および異常(位置ずれや欠落など)を理解できます。これにより、組立ラインの誤った部品の特定、製品の欠陥検出、アイテムの正しい収納場所の判断などに利用できます。さらに、少数例学習により、ユーザーはいくつかの注釈付きサンプルを提示するだけで、モデルを新しいタスクに即座に適応させることができ、時間のかかるファインチューニングは不要です。
Isaacの効率性は、その小さなパラメータ数に起因しています。20億パラメータで、リアルタイム処理やエッジコンピューティング環境でも十分な速度で動作します。これは、ロボット工学、製造自動化、外観検査、大規模文書処理といった産業用途にとって魅力的な選択肢です。
使用方法は、ReplicateのAPIを通じて非常にシンプルです。以下のJavaScriptコード例に示すように、まずReplicateのJavaScriptライブラリをインポートし、インスタンスを作成します。次に画像URLを入力として渡し、モデルを実行すると構造化された出力が得られます。例えば、街路の画像を入力すると、モデルは「今この道路を横断しても安全か」を判断し、答えと対応する領域の証拠を返します。
Isaac 0.1は現在Replicate上で公開されており、興味のある開発者はすぐに試すことができます。Perceptron AIは今後もモデルの最適化を続け、さらなる応用分野を探求する予定です。実世界で信頼性の高い視覚AIを展開したいチームにとって、Isaac 0.1は有望な新たな選択肢を提供します。