Google Researchは、表形式データ専用のゼロショット基盤モデル「TabFM」を発表しました。本モデルはBigQuery MLに直接統合され、分類と回帰のワークフローを簡素化します。これは、TimesFMが時系列予測で成功を収めた後、ゼロショットのアプローチを表形式データに拡張するものです。
表形式データは企業のデータ基盤の中核をなし、顧客離脱予測から金融詐欺検出まで、多くの重要な予測機械学習アプリケーションを支えています。これまで、AdaBoost、XGBoost、ランダムフォレストなどの教師ありツリーベースアルゴリズムが高精度を誇ってきましたが、そのデプロイには多大な手作業が必要でした。データサイエンティストは、ハイパーパラメータ最適化やドメイン固有の特徴量エンジニアリングに多くの時間を費やさなければなりませんでした。
TabFMは、表形式予測をインコンテキスト学習(ICL)問題として再定義することで、この状況を一変させます。従来のパラダイムがデータセットごとにモデルパラメータを更新するのに対し、TabFMは歴史的な訓練例とターゲットテスト行を含むデータセット全体を単一のプロンプトとして扱い、推論時にコンテキストから列と行の関係を直接学習します。モデルの重みを更新することなく、新しいタスクを習得できるのです。
TabFMは、TabPFNやTabICLなどのアーキテクチャの強みを融合したハイブリッド設計を採用しています。その主要メカニズムは以下の3つです:
- 交互行と列の注意:生のテーブルを多層注意モジュールで処理し、列(特徴)と行(事例)に交互に注意を適用することで、複雑な特徴間相互作用を捉えたリッチな表現を学習します。
- 行圧縮:各行のクロスアテンション情報を単一の密ベクトル表現に圧縮します。
- インコンテキスト学習:圧縮された埋め込みのシーケンスにTransformerを適用し、未圧縮のグリッドよりもはるかに低い計算コストで予測を行います。
学習データに関して、TabFMは数億の合成データセットのみで事前学習されています。高品質で多様な公開表形式データセットは希少であり、産業用テーブルは多くの場合独自のスキーマや機密情報を含むため、大規模な事前学習には適しません。そこで、構造的因果モデル(SCM)を用いて動的に生成された合成データが使用され、実世界のデータに見られる多様な分布と複雑な特徴関係をカバーしています。その結果、モデルは未知の実世界テーブルに対しても優れた汎化性能を示します。
性能評価では、TabFMはTabArenaベンチマークで既存手法と比較されました。このベンチマークはEloスコアに基づく総合評価システムで、38の分類データセットと13の回帰データセット(サンプル数700~150,000)をカバーしています。結果として、TabFMの標準構成(単一パス、チューニング不要)と強化版TabFM-Ensemble(交差特徴、SVD特徴、Plattスケーリングを統合)の両方が、XGBoostやランダムフォレストなどの調整済みベースラインを一貫して上回りました。
今後、TabFMはGoogle BigQueryに直接統合される予定です。数週間以内に、ユーザーは機械学習の専門知識がなくても、BigQueryでAI.PREDICT SQLコマンドを使うだけで高度な回帰・分類を実行できるようになります。これにより、現代の基盤モデルがもたらす「箱から出してすぐ使える」利便性が表形式MLワークフローにもたらされ、より多くの実務者が高精度な予測を容易に活用できるようになるでしょう。