近乎读心:科学家利用脑电波实时重建视觉图像
普林斯顿大学研究团队实现基于fMRI的实时视觉重建,在参与者观看图像后约15秒内生成模糊但高度相关的近似图像。该技术有望推动闭环神经科学实验与临床应用,但尚不能读取任意思想或记忆。
想象你躺在核磁共振扫描仪中,注视一张狗的照片。一台计算机分析你的大脑活动,几秒钟后生成一张那只狗的粗略图像——不是读取屏幕上的图片,而是读取你的大脑。这正是普林斯顿大学Kenneth Norman教授团队在最新研究“Real-time Reconstruction of Human Visual Perception from fMRI”中展示的场景:仅利用MRI测得的大脑活动,即可在数秒内重建一个人正在观看的图像。它算不上完美的读心术,但已经足以令人惊叹。
核心思路是将大脑活动转化为图像。当你观看灯塔、滑雪者或一盘食物时,视觉皮层会产生独特的活动模式。功能性磁共振成像(fMRI)通过测量大脑各区域血氧水平的变化来间接捕捉这种活动。数十年来,神经科学家一直试图破解这些模式:如果已知大脑活动模式,能否推断出这个人看到了什么?近年来人工智能的进展让这一问题变得可行——研究者不再试图将大脑活动直接映射到像素,而是先将脑信号转化为图像的高层语义描述,再由生成式AI将其还原为图像。这项新研究证明,这样的解码可以实时完成。
实验本身相当直观。参与者躺在3特斯拉MRI扫描仪中,观看数百张自然图像,如动物、人物和户外场景。每张图像显示数秒,同时扫描仪记录视觉区域的活动。研究者首先收集约一小时的训练数据,让AI系统学习该参与者的大脑对不同图像的响应方式。训练完成后,在第二次扫描中,模型即可重建参与者正在观看的内容。
重建结果并非原图的摄影级复制品,而更像是AI生成的近似画面。如果参与者看到的是一位在雪山上穿红衣的滑雪者,重建图像可能呈现一个红色的类人形轮廓,周围是雪地;如果参与者看到田野中吃草的动物,重建图像可能包含草地景观中的动物形状。这些图像模糊且不完美,但与原始图像明显相关,在多种图像相似度指标上显著优于随机水平。
真正的突破在于速度。早期从fMRI数据重建图像的方法可能需要数小时甚至数天,而该系统在最快的配置下,能在图像被观看后约15秒生成重建结果。这种延迟主要来自生物学限制而非计算能力:fMRI所测量的血氧信号在刺激出现后数秒才达到峰值,并可能需20秒才完全消退。即便受此约束,系统在信号到达后仅需几秒即可完成数据处理和AI模型推理。
实现实时解码面临两大技术挑战。一是fMRI信号本身嘈杂且属于间接测量:扫描仪测量的是与神经活动相关的血流变化,信号缓慢且可能在不同刺激间重叠。二是计算挑战:图像重建AI模型庞大复杂,包含数亿参数,要在接收脑数据的同时快速运行,需要精细的工程设计和大量计算资源。研究者将基于云的实时fMRI框架与精简版MindEye2架构相结合,使系统得以在数秒内完成分析和生成。
这项技术的意义远不止于“读心”噱头。实时解码为闭环神经科学实验打开了大门,研究者可在实验进行的同时分析脑活动并反馈给参与者。例如,监测大脑如何表征视觉刺激,再根据表征调整刺激。在临床方面,实时解码或许能帮助研究者理解抑郁症、焦虑症患者如何解读情绪图像。普林斯顿团队参与的2021年一项研究发现,抑郁症患者在获得脑活动实时反馈后,能更好地忽略带有负面表情的人脸。理论上,重建图像可以揭示个体感知世界的潜在偏见。
当然,我们需要保持清醒。这项系统要求参与者躺进大型且昂贵的MRI扫描仪,需要针对每个个体收集个性化训练数据。最重要的是,它重建的是视觉感知,而非任意思想或记忆。它并非万能读心机,更像是一个在脑活动与视觉表征之间进行翻译的复杂工具。尽管如此,这仍是令人印象深刻的一步。
数十年来,神经科学家一直梦想从大脑活动中解码感知内容。当前的特殊之处在于两大技术革命的交汇:大规模神经影像数据集和强大的生成式AI模型。这使得科学家能够将大脑活动映射到AI已经理解的丰富视觉特征空间中。一旦完成这种映射,生成图像就变得出乎意料地简单。研究得到的图像并不完美,但它们能在看到刺激后数秒内出现,这一点本身就十分惊人。它提示我们,脑信号与主观体验之间的距离,或许比我们曾经认为的更小。我们还没有学会读心,但已经开始描摹思想的轮廓。