思考高質量人類數據
高質量數據是現代深度學習模型訓練的燃料。大多數任務特定標註數據來自人類標註,例如分類任務或用於LLM對齊訓練的RLHF標註(可構造為分類格式)。本文探討了如何通過人類標註收集高質量數據,包括任務設計、標註員選擇與培訓、數據聚合等操作步驟。
人類標註者與數據質量
收集人類數據涉及一系列操作步驟,每一步都對數據質量有貢獻:
- 任務設計:設計任務流程以提高清晰度並降低複雜性。詳細的指南有幫助,但過長複雜的指南需要大量培訓才能發揮作用。
- 選擇並培訓標註員:選擇技能匹配且一致的標註員。培訓課程是必要的。入職後,還需要定期反饋和校準會議。
- 收集並聚合數據:在此階段,可以應用更多機器學習技術來清洗、過濾和智能聚合數據,以識別真實標籤。
眾包的智慧
“Vox populi”(拉丁語,意為“人民的聲音”)一詞最初出現在1907年《自然》雜誌上的一篇短文中。該文跟蹤了一個年度展覽中的事件:選定一頭肥牛,人們猜測其重量,最接近真實值的猜測獲勝。中間估計值(即“眾議”)非常接近真實值。作者得出結論:“我認為,這一結果比人們可能預期的更值得信賴民主判斷。”這可能是關於眾包(“羣眾的智慧”)如何起作用的最早提及。
大約100年後,Callison-Burch(2009)進行了一項早期研究,使用Amazon Mechanical Turk(AMT)對機器翻譯任務進行非專家人工評估,甚至依靠非專家創建新的黃金參考翻譯。評估設置簡單:每個工人看到一個源句、一個參考翻譯以及來自5個MT系統的5個翻譯,要求對5個翻譯進行排序。每個任務由5個工人完成。
不出所料,存在產生低質量標註的垃圾工人,他們只優化數量。因此,在衡量專家與非專家的一致性時,需要應用不同的加權方案來降低垃圾工人的貢獻。
標註者一致性
我們通常認為標註針對單一真實答案,並試圖根據一致的標準評估質量。一種常見做法是收集來自多個標註者的多個標籤。假設每個標註者的質量水平不同,我們可以使用加權平均,但權重由熟練度得分決定。該得分通常通過標註者與其他人的一致程度來近似。
- 多數投票:最簡單的聚合方式,相當於取一組標籤的眾數。每個標註者貢獻相等。
- 原始一致性:計算其他人同意他們的百分比。
- Cohen's Kappa:衡量標註者間一致性,公式為κ = (p_o - p_e)/(1 - p_c),其中p_o是原始一致性率,p_e是偶然一致性。Cohen's Kappa對偶然一致性有修正項,但如果一個標籤更普遍,這種修正可能被高估。
- 概率圖建模:通過概率圖建模來模擬標註決策中的不同因素,如任務難度、任務潛在主題、標註者偏差、標註者置信度,然後預測真實標籤。
MACE(多標註者能力估計)是早期使用圖建模估計某人像“垃圾工人”一樣提供隨機標籤的概率的例子。當激勵不匹配時,一些標註者可能表現像垃圾工人以優化完成任務數量以獲取更高報酬。MACE的目標是識別垃圾工人。
標註者分歧與兩種範式
上述聚合過程依賴於存在一個潛在黃金答案的假設,因此我們可以評估標註者的表現。然而,在許多主題中,尤其是在安全、社會或文化領域,人們可能產生分歧,這種分歧往往是有效的,問題在於我們希望在多大程度上應用嚴格規則與擁抱多樣性。
Aroyo & Welty(2015)討論了人類標註實踐中的一組“神話”,發現它們都不完全準確,關鍵發現包括:
- 通常,某些樣本存在多個正確解釋。需要通過多種視角(例如,讓多人審查標註質量)來獲取多樣化觀點。
- 分歧並非總是壞事。應減少因錯誤或設計不佳過程引起的分歧,但其他分歧可以提供豐富信息。
- 如果是由任務定義不清引起,應增強指導説明。然而,更詳細的指南無法解決意見的固有多樣性。
- 專家並不總比外行好,但在考慮什麼是重要方面存在巨大差距。
- 真實標註可能隨時間變化,尤其是與及時事件或新聞相關的標註。
後來,Rottger等人(2021)將差異形式化為主觀NLP任務數據標註的兩種對比範式:
- 描述性範式:鼓勵標註者主觀性,試圖建模多種信念。優點是可識別更主觀的條目並擁抱多樣性;缺點是無法用分歧衡量數據質量或標註者表現,且不能用於訓練輸出預設行為的模型。
- 規範性範式:不鼓勵標註者主觀性,試圖一致應用一種信念。優點是與標準NLP設置更一致,更容易通過衡量分歧或標籤聚合進行質量控制;缺點是創建高質量標註指南昂貴且具有挑戰性,且無法捕捉可解釋的信念多樣性或一致編碼特定信念。
數據質量與模型訓練
一旦數據集構建完成,許多方法可以根據訓練動態幫助識別錯誤標籤。我們只關注查找和排除可能錯誤標籤數據點的方法,而不涉及如何在噪聲數據上訓練模型。
影響函數
影響函數是魯棒統計中的經典技術,通過描述模型參數隨訓練點微小加權變化來衡量訓練數據點的影響。Koh & Liang(2017)將其引入深度神經網絡。
給定訓練集中的n個數據樣本,模型參數θ優化以最小化損失。移除單個數據點z的參數變化可以近似通過影響函數計算。通過影響函數,我們可以在封閉形式中衡量單個數據點對模型參數和損失函數的影響,有助於近似留一法再訓練而無需實際運行所有再訓練。為了識別錯誤標籤數據,可以測量I_up,loss(z_i, z_i),近似z_i從訓練集中移除時的預測誤差。
訓練過程中的預測變化
另一類方法是在訓練過程中跟蹤模型預測的變化,以識別似乎難以學習的案例。數據映射(Swayamdipta等人,2020)跟蹤訓練過程中模型行為動態的兩個屬性:
- 置信度:模型對真實標籤的平均概率。
- 變異性:置信度的標準差。
難以學習(低置信度、低變異性)的樣本更可能被錯誤標記。實驗發現,硬學習區域包含錯誤標籤樣本。但不應將所有難以學習的樣本視為錯誤。實際上,論文假設模糊(高變異性)和難以學習(低置信度、低變異性)的樣本對學習更有信息量。
遺忘事件:Toneva等人(2019)設計實驗跟蹤每個樣本在訓練過程中的模型預測,並計數每個樣本從正確分類到錯誤分類的轉換次數。發現大量樣本一旦學習就永遠不會忘記。實驗驗證了這些“不可遺忘”樣本可以安全移除而不影響模型性能。
AUM(邊界下面積):Pleiss等人(2020)開發了AUM方法,基於梯度更新中泛化與錯誤預測之間的張力來識別錯誤標籤。對於誤標記樣本,其邊界會小於正確樣本。通過插入偽造的閾值樣本確定閾值。
噪聲交叉驗證
NCV方法隨機將數據集分成兩半,然後將標籤與僅基於另一半訓練的模型預測標籤匹配的數據樣本識別為“乾淨”。INCV迭代運行NCV,添加更多幹淨樣本。
本文總結了人類數據收集和清洗的多種方法,強調高質量數據的重要性,並提供實用的技術指導。