Google Researchのチームは、13,917人の参加者を対象とした全国規模のランダム化研究を実施し、SymptomAIと呼ばれる対話型AIエージェントの症状評価と鑑別診断能力を評価しました。結果は、臨床専門家が50%以上のケースでSymptomAIの鑑別診断リストを他の臨床医のものよりも好み、その診断精度も高いことを示しました。さらに、特に呼吸器感染症において、SymptomAIの診断はFitbitウェアラブルデバイスで記録された心拍数、呼吸数、皮膚温度などの生体信号の変化と有意に相関していました。研究は、積極的な質問戦略が診断性能を大幅に向上させることを示し、AIによる医療診断支援の新たな方向性を示しています。
Google Researchは、500万人から得られた1兆分以上のセンサーデータで事前学習されたウェアラブルヘルス向け基盤モデルSensorFMを発表しました。自己教師あり学習により人間の生理学の汎用表現を獲得し、35の健康タスクに転移可能で、ラベル効率の良い適応をサポートし、パーソナルヘルスエージェントの基盤として機能します。
Google Researchが米国10都市で実施した大規模な実世界研究により、ナビゲーションアプリを使ってごく一部のトリップ(2%未満)をわずかに迂回させることで、交通渋滞と排出量を測定可能なほど削減できることが示されました。Nature Citiesに掲載されたこの研究では、対象区間の走行速度が中央値で約2%向上し、都市あたり年間数千トンのCO2e削減が可能であることがわかりました。
Google Researchが皮膚科AIツールに関する2つの研究を発表。大規模調査ではAI支援によりユーザーが皮膚状態を特定する正確性が3倍近く向上したが、次のステップの判断には改善が見られなかった。地域コミュニティでの定性研究では、アプリがユーザーと臨床医の会話を促進し、92%の臨床医が有用と評価した。
Google Researchのチームは、スマートフォンのフロントカメラを使って日常使用中に心拍数と安静時心拍数をパッシブに測定するシステムPHRMを開発しました。Nature誌に発表された研究では、心拍数の平均絶対パーセント誤差(MAPE)が心電図(ECG)と比較して10%未満、日次の安静時心拍数の平均絶対誤差(MAE)がウェアラブルデバイスと比較して5 bpm未満という精度を達成。システムは、約700名の参加者から収集した35万本以上のビデオクリップからなる多様なデータセットでトレーニングされ、肌色のバランスが確保されています。PHRMは15の主要な遠隔光電容積脈波法(rPPG)モデルを凌駕し、実環境で全肌色に対して精度基準を満たした唯一のモデルです。
Google Research は、オープンサイエンスの原則に基づき、オープンソースソフトウェアとデータセットを通じて世界中の研究コミュニティと協力し、ゲノミクス、神経科学、気候、生物多様性、ヘルスケアなどの分野で画期的な発見を推進しています。本記事では、DeepVariant、Neuroglancer、Open Buildings、SpeciesNet、HAI-DEF などのツールと、その実際の応用例を詳述し、オープンサイエンスがどのように世界中の研究者をエンパワーし、ポジティブな社会的影響を生み出しているかを示しています。
Google Researchとニューヨーク大学は、生成AIを活用してコラボレーションや批判的思考などの未来対応スキルを評価するシステム「Vantage」を開発しました。AIアバターとの会話をエグゼクティブLLMが動的に誘導し、評価は人間の専門家と同等の精度を示しています。VantageはGoogle Labsでサインアップ可能です。
Google Researchは、LLMベースのユーザーシミュレーターにおけるリアリティギャップを定量化し、堅牢な対話エージェントのトレーニングを改善するためのデータセットと評価フレームワークConvApparelを発表しました。デュアルエージェントデータ収集と三本柱の検証により、データ駆動型シミュレーターがプロンプトベースを凌ぐが、ギャップは残ることが示されました。
Google Cloudの研究チームは、高品質な学術図表を自動生成するPaperVizAgentと、厳格な論文査読を自動化するScholarPeerという2つの革新的なAIエージェントを発表しました。これらのシステムはマルチエージェント協調と反復最適化により、各タスクで既存のベースラインを大幅に上回り、科学研究プロセスに実質的な改善をもたらします。
Google Researchは、心理学的質問票を状況判断テストに変換し、LLMの行動傾向と人間のコンセンサスとの整合性を定量化するフレームワークを提案。25のモデルをテストした結果、高いコンセンサスシナリオでは良好な性能を示すが、コンセンサスが低いシナリオでは過剰な自信を示し、人間の意見の多様性を反映できないことが明らかになった。