一篇被机器学习顶会ICML 2026录用、由Dong Lao撰写的立场论文,于2026年9月2日提交至arXiv,编号为2609.03077。文章提出一个容易被忽视的问题:在视觉学习中,数据没有标签并不代表整个学习过程没有人类监督。近年来,许多计算机视觉方法都在大规模无标注数据上学习表征,随后被统一冠上“无监督”的标签。作者认为,这个标签过于笼统,因为无论数据如何收集、过滤和加权,也无论训练目标采用对比学习、掩码重建还是其他代理任务,背后都有人为设定的先验在起作用。模型之所以能学到有用的视觉表示,不只来自数据本身,还来自这些被嵌入流程的、关于任务和世界结构的设计决策。
论文进一步指出,对“无监督”的宽泛使用已经在学术交流中造成困难。不同方法可能只在“没有人工标注”这一点上相似,但它们对数据分布、数据质量、特征空间甚至下游任务的假设可能截然不同。把这些工作放到同一个类别里比较,很容易忽略真正的差异来源;读者也难以判断一项工作的收益究竟来自更大的数据规模、巧妙的数据筛选,还是新的学习目标。文章观察到,自2021年以来,计算机视觉旗舰会议中标题包含“unsupervised”的论文数量出现明显下滑,尽管领域总体仍在增长。作者认为这一变化与术语含义模糊、研究者因此转向更具体表述有关。
值得注意的是,这并不是一篇否定预训练的论文。作者明确表示,预训练已经成为现代计算机视觉的坚实基础,应该继续得到重视。他们想要改变的是社区描述和比较这些方法的方式。论文建议作者在论文中更系统地披露几类信息:数据筛选环节使用了哪些人工先验,例如去重规则、域选择、样本采样的偏好;训练目标中内含哪些假设,例如为什么选择某个代理任务或如何构造正负样本;以及学习流程中的各个组件分别依赖哪些假设。只有把这些依赖显式写出来,读者才能准确判断方法的适用范围和真正贡献。
在作者看来,标准化披露能够带来三方面收益。第一,研究者可以直接在使用同一套概念的语言下交流,减少由术语造成的信息损耗。第二,不同方法可以在同一套假设参照下进行更公平的比较,避免因为数据筛选或训练设计的差异而被错误归因。第三,披露能够保护无监督学习内部的方法多样性:当不同方法的技术细节被认真区分时,研究者不会为了迎合某一种流行表述而放弃自己的研究路径。这篇论文属于计算机视觉与模式识别(cs.CV)与机器学习(cs.LG),并带有ICML 2026的录用信息;其arXiv页面对应提交时间为2026年9月2日18:45:41 UTC。