AI News HubLIVE
站內改寫2 分鐘閱讀

ProgFormer:層級化體素擴散Transformer實現縱向腦部MRI預測

arXiv 新論文提出 ProgFormer,一種直接在體素空間執行的層級擴散 Transformer,用於預測未來腦部結構 MRI。它透過粗路徑建模整體腦結構和縱向上下文,細路徑在區域性 patch 內進行體素級精化,並利用條件流匹配估計速度場,避免潛在空間重建的資訊損失。在 ADNI、AIBL 和 OASIS 基準上的成對及軌跡設定實驗中表現優於多種現有方法。

來源arXiv Computer Vision作者: Dexuan Ding, Yuankai Qi, Luping Zhou, Jian Yang, Quan Z. Sheng, Ming-Hsuan Yang

預測腦部未來結構 MRI 是神經影像分析中的一項挑戰:疾病進展往往表現為細微且侷限於特定解剖區域的變化,而個體大腦的大部分結構隨時間保持穩定。因此,理想模型既要保持整體腦結構的一致性,又要對細粒度病情進展足夠敏感。現有基於潛在空間的方法儘管計算效率高,但在壓縮-重建過程中容易丟失資訊;直接基於體素空間的方法雖無需潛在重建,卻常用統一預測通路處理腦結構與進展變化,導致細微區域性變化可能被佔主導的穩定結構掩蓋。

針對這些問題,來自 arXiv 的新研究提出 ProgFormer——一種層級式體素空間擴散 Transformer。其核心思想是將預測任務拆分為粗、細兩條通路:粗通路以三維 patch token 為基礎,完成主要的體積預測,建模整體腦結構和縱向變化背景;細通路則利用粗通路產生的表徵作為時空基礎,在單個 patch 內進行體素級精化。兩條通路共同透過條件流匹配直接在體素空間中估計速度場,從而無需單獨學習影像自編碼器即可實現端到端預測。最終,模型從高斯噪聲出發,透過一系列尤拉步積分該速度場,生成未來的腦部掃描影像。

這種方法的設計出發點在於:粗通路避免細微變化被整體穩定性淹沒,細通路則在不引入潛在空間失真的前提下恢復區域性細節。由於速度場估計完全在原始體素空間完成,ProgFormer 繞過了 latent-space 方法中的資訊瓶頸,也避免了統一通路對區域性變化的忽視。

論文報告了在三個廣泛使用的縱向腦影像基準——ADNI、AIBL 和 OASIS——上的實驗,覆蓋成對預測(pairwise)和軌跡預測(trajectory)兩種設定。結果顯示,與多種當前最優方法相比,ProgFormer 在預測精度和結構一致性方面均取得更好表現,驗證了層級雙通路設計的有效性。

該論文由 Dexuan Ding 等人提交,於 2026 年 7 月 30 日釋出在 arXiv,編號為 arXiv:2607.27537,歸類於計算機視覺與模式識別(cs.CV)。論文透過 DataCite 獲得 arXiv DOI(https://doi.org/10.48550/arXiv.2607.27537),目前 DOI 註冊尚待完成。相關程式碼、資料及引用工具連結已在 arXiv 頁面提供。