一篇被機器學習頂會ICML 2026錄用、由Dong Lao撰寫的立場論文,於2026年9月2日提交至arXiv,編號為2609.03077。文章提出一個容易被忽視的問題:在視覺學習中,數據沒有標籤並不代表整個學習過程沒有人類監督。近年來,許多計算機視覺方法都在大規模無標註數據上學習表徵,隨後被統一冠上“無監督”的標籤。作者認為,這個標籤過於籠統,因為無論數據如何收集、過濾和加權,也無論訓練目標採用對比學習、掩碼重建還是其他代理任務,背後都有人為設定的先驗在起作用。模型之所以能學到有用的視覺表示,不只來自數據本身,還來自這些被嵌入流程的、關於任務和世界結構的設計決策。
論文進一步指出,對“無監督”的寬泛使用已經在學術交流中造成困難。不同方法可能只在“沒有人工標註”這一點上相似,但它們對數據分佈、數據質量、特徵空間甚至下游任務的假設可能截然不同。把這些工作放到同一個類別裏比較,很容易忽略真正的差異來源;讀者也難以判斷一項工作的收益究竟來自更大的數據規模、巧妙的數據篩選,還是新的學習目標。文章觀察到,自2021年以來,計算機視覺旗艦會議中標題包含“unsupervised”的論文數量出現明顯下滑,儘管領域總體仍在增長。作者認為這一變化與術語含義模糊、研究者因此轉向更具體表述有關。
值得注意的是,這並不是一篇否定預訓練的論文。作者明確表示,預訓練已經成為現代計算機視覺的堅實基礎,應該繼續得到重視。他們想要改變的是社區描述和比較這些方法的方式。論文建議作者在論文中更系統地披露幾類信息:數據篩選環節使用了哪些人工先驗,例如去重規則、域選擇、樣本採樣的偏好;訓練目標中內含哪些假設,例如為什麼選擇某個代理任務或如何構造正負樣本;以及學習流程中的各個組件分別依賴哪些假設。只有把這些依賴顯式寫出來,讀者才能準確判斷方法的適用範圍和真正貢獻。
在作者看來,標準化披露能夠帶來三方面收益。第一,研究者可以直接在使用同一套概念的語言下交流,減少由術語造成的信息損耗。第二,不同方法可以在同一套假設參照下進行更公平的比較,避免因為數據篩選或訓練設計的差異而被錯誤歸因。第三,披露能夠保護無監督學習內部的方法多樣性:當不同方法的技術細節被認真區分時,研究者不會為了迎合某一種流行表述而放棄自己的研究路徑。這篇論文屬於計算機視覺與模式識別(cs.CV)與機器學習(cs.LG),並帶有ICML 2026的錄用信息;其arXiv頁面對應提交時間為2026年9月2日18:45:41 UTC。