一篇關於冷凍電子斷層掃描(cryo-ET)蛋白質註釋的研究論文近日在arXiv上發表。該論文的標題為“顯微鏡是面具:來自冷凍電子斷層掃描前向模型的特權視圖和標籤”,作者是Bogdan Toader、Kiarash Jamali、Tanmay A. M. Bharat和Sjors H. W. Scheres。論文於2026年9月3日提交,共18頁,包含7幅圖,涉及計算機視覺與模式識別、機器學習以及優化與控制等多個學科。
研究聚焦於一個關鍵挑戰:在擁擠的冷凍電子斷層掃描體數據中,由於圖像在有限傾斜角度下采集且受到測量算子的嚴重破壞,蛋白質註釋變得非常困難。為此,團隊探索了使用模擬數據來訓練模型的方法。他們的核心策略有兩點。第一,利用前向模型帶來的降質效應,生成同一場景的域特定增強配對視圖,用於一種不變性目標,並將其整合到LeJEPA自監督訓練框架中。第二,從模擬管道中提取額外的信息,例如模擬體積中蛋白質的位置和身份,用以指導模型架構和損失函數的設計,從而使語義信息能夠定位在生成的緻密特徵體積中蛋白質所在的位置。
由此產生的模型被命名為CARNIVAL。在評估階段,該模型沒有經過微調,直接用於真實斷層掃描圖中的分類和檢測任務,測試基準數據集包含多種蛋白質類型和兩種斷層掃描處理類型。實驗結果表明,CARNIVAL的性能優於一種最先進的對比學習模型,後者同樣在模擬數據上訓練,但沒有使用基於前向模型的配對視圖或特權信息。
這項研究巧妙地利用了模擬過程中的“特權”信息,即數據生成時已知的蛋白質位置和身份,來幫助模型學習更具語義相關性的特徵。同時,通過模擬真實顯微鏡成像過程中的降質效應,產生配對視圖來增強自監督學習,使得模型能夠更好地應對實際成像中的噪聲和缺失角度問題。這種“顯微鏡是面具”的思路,意味着成像過程中的各種失真和限制,反而成為訓練模型的一種有效數據增強手段。
該工作有望推動冷凍電子斷層掃描自動註釋技術的發展,為結構生物學家提供更強大的工具,以解析細胞內部複雜的三維結構。論文的完整內容可通過arXiv獲取,編號為2609.04325,即將被分配DOI。