ZipTok3D:利用緊湊標記字首實現高保真3D標記化
ZipTok3D是一種面向極短標記序列的3D標記化方法,透過“逐步增加資訊量的全域性標記字首”和迭代解碼實現高保真重建。訓練中使用巢狀dropout隨機截斷潛在標記序列,要求每個保留的字首都能重建完整物體,從而把關鍵幾何資訊集中到前部標記。解碼時,引數共享的Transformer塊被反覆應用,無需獨立的生成式取樣階段即可恢復精細幾何。實驗顯示,在相同標記維度下,ZipTok3D在ShapeNet上僅用1個標記、在TRELLIS上僅用4個標記,即可達到與32標記的COD-VAE基線相當的重建質量,分別將標記序列縮短32倍和8倍。
三維生成模型通常將物體表示為離散的token序列,token的數量直接決定後續自迴歸或擴散模型的生成成本。近期arXiv上的研究ZipTok3D提出了一套專為極短序列設計的高保真3D標記化方案。論文由Mingda Lin與另外九位作者合作完成,2026年9月1日提交,編號arXiv:2609.01740,全文含附錄共25頁,配有9幅圖和6張表格,研究方向屬於計算機視覺與模式識別(cs.CV)。
長期以來,3D tokenizer的設計主要有兩條路線:一種是按空間區域劃分潛在表示,另一種是使用固定數量的全域性token。前者能較好地保留區域性細節,但在token數量受到嚴格限制時,空間解析度不足會導致結構缺失;後者把所有資訊壓縮到一組預定長度的特徵中,token越少,資訊瓶頸就越嚴重。因此無論哪種方法,在壓縮至極低token預算時,重建質量都會出現劇烈下降。這個問題制約了3D生成模型在即時互動、頻寬受限或記憶體敏感場景中的應用。
ZipTok3D的思路是讓token序列形成“逐級增加資訊量的全域性字首”。他們將整個物體的幾何編碼為一個潛在token序列,並在訓練中引入巢狀dropout(nested dropout):每次前向傳播後,隨機選取一個截斷點,丟棄後續的全部token,同時要求僅憑保留下來的字首也能重建出完整形狀。這樣一來,頭部的少量token必須優先承載物體最核心的幾何資訊,例如整體輪廓、大致比例和主要部件;越靠後的token則補充越來越細的區域性形狀。訓練完成後,模型便獲得了一種由粗到精的緊湊表示。解碼時,ZipTok3D反覆使用同一個引數共享的Transformer塊處理當前字首,透過多次迭代逐步恢復精細幾何形狀。這個解碼過程不再需要額外的生成式取樣階段,也避免了為不同長度字首單獨設計專用解碼器。
實驗部分驗證了這種設計在相同token維度下的優勢。作者以COD-VAE的32-token輸出作為基線,在ShapeNet和TRELLIS兩個基準上比較重建質量。結果顯示,ZipTok3D在ShapeNet上只需1個token、在TRELLIS上只需4個token,就能達到與32-token COD-VAE相當的重建效果。這相當於所需token序列長度分別縮短到原來的1/32和1/8。值得注意的是,論文同時報告了更短的token序列能帶來更好的生成效率,但並未宣稱在絕對質量上超過消耗更多token的模型;它的核心貢獻在於拉高了極短序列下的質量上限。