AI News HubLIVE
站內改寫3 分鐘閱讀

近乎讀心:科學家利用腦電波即時重建視覺影像

普林斯頓大學研究團隊實現基於fMRI的即時視覺重建,在參與者觀看影像後約15秒內生成模糊但高度相關的近似影像。該技術有望推動閉環神經科學實驗與臨床應用,但尚不能讀取任意思想或記憶。

來源Hacker News AI作者: taylorbuley

想象你躺在核磁共振掃描器中,注視一張狗的照片。一臺計算機分析你的大腦活動,幾秒鐘後生成一張那隻狗的粗略影像——不是讀取螢幕上的圖片,而是讀取你的大腦。這正是普林斯頓大學Kenneth Norman教授團隊在最新研究“Real-time Reconstruction of Human Visual Perception from fMRI”中展示的場景:僅利用MRI測得的大腦活動,即可在數秒內重建一個人正在觀看的影像。它算不上完美的讀心術,但已經足以令人驚歎。

核心思路是將大腦活動轉化為影像。當你觀看燈塔、滑雪者或一盤食物時,視覺皮層會產生獨特的活動模式。功能性磁共振成像(fMRI)透過測量大腦各區域血氧水平的變化來間接捕捉這種活動。數十年來,神經科學家一直試圖破解這些模式:如果已知大腦活動模式,能否推斷出這個人看到了什麼?近年來人工智慧的進展讓這一問題變得可行——研究者不再試圖將大腦活動直接對映到畫素,而是先將腦訊號轉化為影像的高層語義描述,再由生成式AI將其還原為影像。這項新研究證明,這樣的解碼可以即時完成。

實驗本身相當直觀。參與者躺在3特斯拉MRI掃描器中,觀看數百張自然影像,如動物、人物和戶外場景。每張影像顯示數秒,同時掃描器記錄視覺區域的活動。研究者首先收集約一小時的訓練資料,讓AI系統學習該參與者的大腦對不同影像的響應方式。訓練完成後,在第二次掃描中,模型即可重建參與者正在觀看的內容。

重建結果並非原圖的攝影級複製品,而更像是AI生成的近似畫面。如果參與者看到的是一位在雪山上穿紅衣的滑雪者,重建影像可能呈現一個紅色的類人形輪廓,周圍是雪地;如果參與者看到田野中吃草的動物,重建影像可能包含草地景觀中的動物形狀。這些影像模糊且不完美,但與原始影像明顯相關,在多種影像相似度指標上顯著優於隨機水平。

真正的突破在於速度。早期從fMRI資料重建影像的方法可能需要數小時甚至數天,而該系統在最快的配置下,能在影像被觀看後約15秒生成重建結果。這種延遲主要來自生物學限制而非計算能力:fMRI所測量的血氧訊號在刺激出現後數秒才達到峰值,並可能需20秒才完全消退。即便受此約束,系統在訊號到達後僅需幾秒即可完成資料處理和AI模型推理。

實現即時解碼面臨兩大技術挑戰。一是fMRI訊號本身嘈雜且屬於間接測量:掃描器測量的是與神經活動相關的血流變化,訊號緩慢且可能在不同刺激間重疊。二是計算挑戰:影像重建AI模型龐大複雜,包含數億引數,要在接收腦資料的同時快速執行,需要精細的工程設計和大量計算資源。研究者將基於雲的即時fMRI框架與精簡版MindEye2架構相結合,使系統得以在數秒內完成分析和生成。

這項技術的意義遠不止於“讀心”噱頭。即時解碼為閉環神經科學實驗開啟了大門,研究者可在實驗進行的同時分析腦活動並反饋給參與者。例如,監測大腦如何表徵視覺刺激,再根據表徵調整刺激。在臨床方面,即時解碼或許能幫助研究者理解憂鬱症、焦慮症患者如何解讀情緒影像。普林斯頓團隊參與的2021年一項研究發現,憂鬱症患者在獲得腦活動即時反饋後,能更好地忽略帶有負面表情的人臉。理論上,重建影像可以揭示個體感知世界的潛在偏見。

當然,我們需要保持清醒。這項系統要求參與者躺進大型且昂貴的MRI掃描器,需要針對每個個體收集個性化訓練資料。最重要的是,它重建的是視覺感知,而非任意思想或記憶。它並非萬能讀心機,更像是一個在腦活動與視覺表徵之間進行翻譯的複雜工具。儘管如此,這仍是令人印象深刻的一步。

數十年來,神經科學家一直夢想從大腦活動中解碼感知內容。當前的特殊之處在於兩大技術革命的交匯:大規模神經影像資料集和強大的生成式AI模型。這使得科學家能夠將大腦活動對映到AI已經理解的豐富視覺特徵空間中。一旦完成這種對映,生成影像就變得出乎意料地簡單。研究得到的影像並不完美,但它們能在看到刺激後數秒內出現,這一點本身就十分驚人。它提示我們,腦訊號與主觀體驗之間的距離,或許比我們曾經認為的更小。我們還沒有學會讀心,但已經開始描摹思想的輪廓。