Google Researchは、ウェアラブルヘルスデータのための汎用基盤モデル「SensorFM」を発表しました。このモデルは、500万人の同意を得た参加者から収集された1兆分以上のマルチモーダルセンサーデータで事前学習されています。SensorFMは自己教師あり学習を用いて人間の生理学の汎用表現を学習し、心血管、代謝、睡眠、メンタルヘルスなど35の健康予測タスクに転移可能です。また、ラベル効率の良い適応やデータ補完をサポートし、パーソナルヘルスエージェントの基盤としても機能します。
事前学習コーパスには、2024年9月から2025年9月までの間に100カ国以上、全米50州、20以上のFitbitおよびPixel Watchデバイスモデルから収集された匿名化データが使用されました。各参加者から数週間分のデータを抽出し、合計20億時間以上の分単位信号を取得しました。SensorFMは、光電式容積脈波記録、加速度計、皮膚電気活動、皮膚温度、高度計の5つのセンサーモダリティから導出された34の1分間集約特徴量を入力とし、24時間ウィンドウ内の心拍数・心拍変動性、血中酸素飽和度、睡眠段階、運動・歩数、皮膚コンダクタンス、温度を捉えます。
SensorFMは、ラベルに依存せず、欠損認識マスキングアプローチに基づく自己教師あり再構成を通じて学習します。従来の自己教師あり手法は完全な連続入力を前提とするため、ギャップを補完するか不完全なウィンドウを破棄する必要がありましたが、AIMフレームワークは実際の欠損を自然なアーティファクトとして扱い、入力の不完全さを積極的に活用します。この設計により、SensorFMは欠損データを単に許容するだけでなく、生成タスクにおいても有効に利用できます。
スケーリング実験では、事前学習データ量を約200万センサー時間から20億時間、モデルサイズを10万から1億パラメータまで変化させました。結果、事前学習損失はデータと容量の増加に伴って予測可能に減少し、下流タスクの性能も向上しました。最大モデルSensorFM-Bは35タスク中33タスクで最良の結果を示し、最小バリアントと比較して再構成損失が31%低下、分類タスクのAUCが平均9%、回帰タスクのピアソン係数が平均21%向上しました。両方の次元を同時にスケールすることでほぼ線形の利得が得られ、飽和の兆候は見られません。
学習された表現の汎用性を評価するため、3つの独立した前向き研究から得られた13,985人の参加者データを用いて35の識別的健康タスクでテストしました。SensorFMエンコーダを凍結し、その上に線形分類ヘッドのみを訓練したところ、34のタスクで特徴量エンジニアリングに基づく教師ありベースラインを上回りました。人口統計的特徴(年齢、性別など)を追加するとわずかな向上が見られましたが、モデルが大きくなるにつれてその利得は縮小し、大モデルが事前学習中に生理学的関連特性を暗黙的に捉えていることが示唆されました。特にうつ病や不安症のような測定困難な状態において、SensorFMは個人差を学習し、優れた性能を発揮しました。ラベル効率実験では、少数のラベル例でベースラインを迅速に上回ることが確認されました。
予測ヘッドの構築を自動化するため、研究チームは「エージェント教室」を構築しました。これは、協調・競争するLLMエージェントが反復的にコードを生成・テスト・洗練するシステムです。3万以上の候補解を探索し、エージェントが設計したヘッドは20の分類タスク中16、15の回帰タスク中12で単純な線形プローブを上回りました。解の質は探索の進行とともに単調に向上し、基盤となるLLMの能力に応じてスケールしました。
最後に、SensorFMをパーソナルヘルスエージェントに統合し、31の実参加者プロファイルから健康サマリーを生成する実験を行いました。人口統計+日次ウェアラブルメトリクスのみをベースラインとし、そこにSensorFMの予測または実際の測定値を追加した条件を比較したところ、臨床医の盲検評価において、SensorFMを追加した条件がすべての評価次元でベースラインを有意に上回り、実際の測定値を使用した条件との統計的有意差は見られませんでした。これは、SensorFMの推論がエージェントにとって実際のラベルと同等に有用であることを示しています。
SensorFMは、ウェアラブルヘルス研究におけるパラダイムシフトを示しており、多数の単一目的モデルから、柔軟かつ効率的に適応可能な単一の汎用生理表現への移行を促進します。