ZipTok3D:利用緊湊標記前綴實現高保真3D標記化
ZipTok3D是一種面向極短標記序列的3D標記化方法,通過“逐步增加信息量的全局標記前綴”和迭代解碼實現高保真重建。訓練中使用嵌套dropout隨機截斷潛在標記序列,要求每個保留的前綴都能重建完整物體,從而把關鍵幾何信息集中到前部標記。解碼時,參數共享的Transformer塊被反覆應用,無需獨立的生成式採樣階段即可恢復精細幾何。實驗顯示,在相同標記維度下,ZipTok3D在ShapeNet上僅用1個標記、在TRELLIS上僅用4個標記,即可達到與32標記的COD-VAE基線相當的重建質量,分別將標記序列縮短32倍和8倍。
三维生成模型通常将物体表示为离散的token序列,token的数量直接决定后续自回归或扩散模型的生成成本。近期arXiv上的研究ZipTok3D提出了一套专为极短序列设计的高保真3D标记化方案。论文由Mingda Lin与另外九位作者合作完成,2026年9月1日提交,编号arXiv:2609.01740,全文含附录共25页,配有9幅图和6张表格,研究方向属于计算机视觉与模式识别(cs.CV)。
长期以来,3D tokenizer的设计主要有两条路线:一种是按空间区域划分潜在表示,另一种是使用固定数量的全局token。前者能较好地保留局部细节,但在token数量受到严格限制时,空间分辨率不足会导致结构缺失;后者把所有信息压缩到一组预定长度的特征中,token越少,信息瓶颈就越严重。因此无论哪种方法,在压缩至极低token预算时,重建质量都会出现剧烈下降。这个问题制约了3D生成模型在实时交互、带宽受限或内存敏感场景中的应用。
ZipTok3D的思路是让token序列形成“逐级增加信息量的全局前缀”。他们将整个物体的几何编码为一个潜在token序列,并在训练中引入嵌套dropout(nested dropout):每次前向传播后,随机选取一个截断点,丢弃后续的全部token,同时要求仅凭保留下来的前缀也能重建出完整形状。这样一来,头部的少量token必须优先承载物体最核心的几何信息,例如整体轮廓、大致比例和主要部件;越靠后的token则补充越来越细的局部形状。训练完成后,模型便获得了一种由粗到精的紧凑表示。解码时,ZipTok3D反复使用同一个参数共享的Transformer块处理当前前缀,通过多次迭代逐步恢复精细几何形状。这个解码过程不再需要额外的生成式采样阶段,也避免了为不同长度前缀单独设计专用解码器。
实验部分验证了这种设计在相同token维度下的优势。作者以COD-VAE的32-token输出作为基线,在ShapeNet和TRELLIS两个基准上比较重建质量。结果显示,ZipTok3D在ShapeNet上只需1个token、在TRELLIS上只需4个token,就能达到与32-token COD-VAE相当的重建效果。这相当于所需token序列长度分别缩短到原来的1/32和1/8。值得注意的是,论文同时报告了更短的token序列能带来更好的生成效率,但并未宣称在绝对质量上超过消耗更多token的模型;它的核心贡献在于拉高了极短序列下的质量上限。