AI News HubLIVE
サイト内リライト4 分で読了

ほぼ読心術:科学者らが脳波から視覚イメージのリアルタイム再構築に成功

プリンストン大学の研究チームは、fMRIデータから知覚画像をリアルタイムで再構築し、被験者が画像を見てから約15秒以内にぼやけつつも関連性の高い近似画像を生成した。この技術はクローズドループ神経科学や臨床応用への道を開くが、万能な読心装置ではない。

ソースHacker News AI著者: taylorbuley

MRIスキャナーに横たわり、犬の写真を見ているところを想像してください。コンピューターがあなたの脳活動を分析し、数秒後にはその犬のおおよその画像を生成します。スクリーン上の画像を読むのではなく、あなたの脳を読むのです。これはプリンストン大学のKenneth Norman教授が指導する研究チームによる新しい研究「Real-time Reconstruction of Human Visual Perception from fMRI」の前提であり、MRIスキャナーで測定した脳活動だけを使い、人が見ている画像を数秒以内に再構築できることを示しています。完全な読心術ではありませんが、思わず二度見してしまうほど近いものです。

大きなアイデアは、脳活動を画像に変換することです。灯台、スキーをする人、食べ物の皿など、何かを見るとき、視覚野は独特の活動パターンを示します。機能的MRI(fMRI)は、脳全体の血中酸素濃度の変化を通じてこの活動を間接的に測定します。何十年もの間、神経科学者はこれらのパターンを解読しようと試みてきました。脳活動パターンが分かれば、その人が何を見ているのかを突き止められるか——この問いは昔からシンプルでありながら答えるのが非常に困難でした。近年のAIの進歩により、この問いは格段に扱いやすくなりました。脳活動を画素に直接マッピングする代わりに、現代のアプローチでは脳信号を画像の高次表現、つまり視覚的特徴の意味的記述へ変換します。その表現が得られれば、生成AIがそれを画像に戻すことができます。この新しい研究は、そのようなデコードがリアルタイムで可能になったことを示しています。

実験自体は驚くほど直接的です。参加者は3テスラのMRIスキャナーに横たわり、動物や人物、屋外の風景などの何百もの自然画像を見ます。各画像は数秒間表示され、その間スキャナーは脳の視覚領域の活動を測定しました。研究者らはまず、参加者から約1時間分のトレーニングデータを収集します。このフェーズで、AIシステムはその個人の脳がさまざまな画像にどう反応するかを学習します。トレーニング後、モデルは2回目のスキャンセッションで参加者が見ているものを再構築するために使えます。

再構築画像は元の画像の写真のようなコピーではありません。むしろAIが生成した近似画像のように見えます。参加者が雪山で赤いジャケットを着たスキーヤーを見ていた場合、再構築画像には雪に囲まれた赤い人物のような形が示されるかもしれません。参加者が野原で草を食べる動物たちを見ていた場合、草の風景の中に動物のような形を含むシーンが生成されるかもしれません。これらはぼやけて不完全ですが、元の画像と明らかに関連しています。詳細は正確でなくても、シーンの大まかな構造と意味を捉えているのです。定量的にも、再構築は研究で使われた複数の画像類似度指標において偶然よりも有意に優れています。

真のブレークスルーは速度です。以前のfMRIデータからの画像再構築方法は数時間、場合によっては数日かかることもありました。このシステムははるかに高速です。最速の構成では、研究者らは画像が見られてから約15秒後に再構築画像を生成できました。瞬間的とは言えないかもしれませんが、fMRIとしては驚くほど高速です。遅延のほとんどは計算能力ではなく生物学的な制約によるものです。fMRIが測定する血中酸素シグナルは、刺激が出てから数秒後にピークに達し、完全に消えるまで最大20秒かかることがあります。その制約があっても、システムはシグナルが届いてから数秒で脳データを処理しAIモデルを実行します。

リアルタイムの脳デコードが技術的に難しい理由は2つあります。第一に、fMRIシグナルはノイズが多く間接的です。ニューロンを直接測定する代わりに、スキャナーは神経活動に伴う血流変化を測定します。このシグナルはゆっくりと展開し、複数の刺激にわたって重なることがあります。第二に計算上の課題です。画像再構築に使われるAIモデルは数億のパラメータを持つ大規模で複雑なもので、入力される脳データに追いつくだけの速さで実行するには、慎重なエンジニアリングと相当な計算リソースが必要です。研究者らは、クラウドベースのリアルタイムfMRIフレームワークと簡略化されたMindEye2アーキテクチャを組み合わせることで、脳活動の分析と再構築生成を数秒で行えるようにしました。

「読心術」という見出しの向こうに、この技術が可能にする本当の意義があります。リアルタイムデコードは、実験の最中に脳活動を分析して参加者にフィードバックできるクローズドループ神経科学実験への扉を開きます。例えば、研究者は脳が視覚刺激をどのように表現しているかを監視し、その表現に基づいて刺激を調整できるようになります。臨床応用の可能性もあります。リアルタイムデコードは、うつ病や不安障害などの人々が感情的な画像や刺激をどのように解釈するかを研究者が理解するのに役立つかもしれません。プリンストン大学の研究者らが参加した2021年の研究では、うつ病患者が脳活動のリアルタイムフィードバックを受けると、否定的な表情の顔を無視するのが上手くなることが分かっています。原理的には、再構築画像は人が世界を知覚する際の微妙なバイアスを明らかにできるかもしれません。

注意点も確認しておきましょう。地下鉄で誰かに思考を読まれる心配をする前に、限界を強調する価値があります。このシステムは、被験者が大型で高価なMRIスキャナーの中に横たわる必要があります。また、確実にデコードするには各個人のトレーニングデータが必要です。そして最も重要なのは、それは視覚知覚を再構築するものであり、任意の思考や記憶ではありません。これは万能な読心装置ではなく、脳活動と視覚表現の間の高度な変換器のようなものです。それでも、これは印象的な前進です。

何十年もの間、神経科学者は脳活動から知覚の内容をデコードすることを夢見てきました。今回の瞬間が特別なのは、大規模な神経画像データセットと強力な生成AIモデルという二つの技術革命が収束したからです。これらが一体となることで、科学者は脳活動をAIがすでに理解している豊かな視覚的特徴空間にマッピングできます。そのマッピングが一度確立されれば、画像の生成は驚くほど簡単になります。この研究で再構築された画像は完璧ではありません。しかし、それらが存在し、刺激を見てから数秒以内に現れるという事実自体が注目に値します。脳信号と主観的体験の間の隔たりは、かつて考えられていたよりも小さいのかもしれません。私たちはまだ心を読むことはできません。しかし、そのスケッチを始めようとしています。