跳到主要內容
AI News HubLIVE
站內改寫4 分鐘閱讀

思考高質量人類資料

文章摘要

高質量資料是現代深度學習模型訓練的燃料。本文探討了如何透過人類標註收集高質量資料,包括任務設計、標註員選擇與培訓、資料聚合等操作步驟。文章還介紹了眾包智慧、標註者一致性評估方法(如Cohen's Kappa、MACE)以及兩種標註正規化(描述性與規範性)。此外,討論了利用影響函式、訓練動態(如資料對映、遺忘事件、AUM)和噪聲交叉驗證來識別錯誤標籤的技術。

思考高質量人類資料
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

思考高質量人類資料

高質量資料是現代深度學習模型訓練的燃料。大多數任務特定標註資料來自人類標註,例如分類任務或用於LLM對齊訓練的RLHF標註(可構造為分類格式)。本文探討了如何透過人類標註收集高質量資料,包括任務設計、標註員選擇與培訓、資料聚合等操作步驟。

人類標註者與資料質量

收集人類資料涉及一系列操作步驟,每一步都對資料質量有貢獻:

  • 任務設計:設計任務流程以提高畫質晰度並降低複雜性。詳細的指南有幫助,但過長複雜的指南需要大量培訓才能發揮作用。
  • 選擇並培訓標註員:選擇技能匹配且一致的標註員。培訓課程是必要的。入職後,還需要定期反饋和校準會議。
  • 收集並聚合資料:在此階段,可以應用更多機器學習技術來清洗、過濾和智慧聚合資料,以識別真實標籤。

眾包的智慧

“Vox populi”(拉丁語,意為“人民的聲音”)一詞最初出現在1907年《自然》雜誌上的一篇短文中。該文跟蹤了一個年度展覽中的事件:選定一頭肥牛,人們猜測其重量,最接近真實值的猜測獲勝。中間估計值(即“眾議”)非常接近真實值。作者得出結論:“我認為,這一結果比人們可能預期的更值得信賴民主判斷。”這可能是關於眾包(“群眾的智慧”)如何起作用的最早提及。

大約100年後,Callison-Burch(2009)進行了一項早期研究,使用Amazon Mechanical Turk(AMT)對機器翻譯任務進行非專家人工評估,甚至依靠非專家建立新的黃金參考翻譯。評估設定簡單:每個工人看到一個源句、一個參考翻譯以及來自5個MT系統的5個翻譯,要求對5個翻譯進行排序。每個任務由5個工人完成。

不出所料,存在產生低質量標註的垃圾工人,他們只最佳化數量。因此,在衡量專家與非專家的一致性時,需要應用不同的加權方案來降低垃圾工人的貢獻。

標註者一致性

我們通常認為標註針對單一真實答案,並試圖根據一致的標準評估質量。一種常見做法是收集來自多個標註者的多個標籤。假設每個標註者的質量水平不同,我們可以使用加權平均,但權重由熟練度得分決定。該得分通常透過標註者與其他人的一致程度來近似。

  • 多數投票:最簡單的聚合方式,相當於取一組標籤的眾數。每個標註者貢獻相等。
  • 原始一致性:計算其他人同意他們的百分比。
  • Cohen's Kappa:衡量標註者間一致性,公式為κ = (p_o - p_e)/(1 - p_c),其中p_o是原始一致性率,p_e是偶然一致性。Cohen's Kappa對偶然一致性有修正項,但如果一個標籤更普遍,這種修正可能被高估。
  • 機率圖建模:透過機率圖建模來模擬標註決策中的不同因素,如任務難度、任務潛在主題、標註者偏差、標註者置信度,然後預測真實標籤。

MACE(多標註者能力估計)是早期使用圖建模估計某人像“垃圾工人”一樣提供隨機標籤的機率的例子。當激勵不匹配時,一些標註者可能表現像垃圾工人以最佳化完成任務數量以獲取更高報酬。MACE的目標是識別垃圾工人。

標註者分歧與兩種正規化

上述聚合過程依賴於存在一個潛在黃金答案的假設,因此我們可以評估標註者的表現。然而,在許多主題中,尤其是在安全、社會或文化領域,人們可能產生分歧,這種分歧往往是有效的,問題在於我們希望在多大程度上應用嚴格規則與擁抱多樣性。

Aroyo & Welty(2015)討論了人類標註實踐中的一組“神話”,發現它們都不完全準確,關鍵發現包括:

  • 通常,某些樣本存在多個正確解釋。需要透過多種視角(例如,讓多人審查標註質量)來獲取多樣化觀點。
  • 分歧並非總是壞事。應減少因錯誤或設計不佳過程引起的分歧,但其他分歧可以提供豐富資訊。
  • 如果是由任務定義不清引起,應增強指導說明。然而,更詳細的指南無法解決意見的固有多樣性。
  • 專家並不總比外行好,但在考慮什麼是重要方面存在巨大差距。
  • 真實標註可能隨時間變化,尤其是與及時事件或新聞相關的標註。

後來,Rottger等人(2021)將差異形式化為主觀NLP任務資料標註的兩種對比正規化:

  • 描述性正規化:鼓勵標註者主觀性,試圖建模多種信念。優點是可識別更主觀的條目並擁抱多樣性;缺點是無法用分歧衡量資料質量或標註者表現,且不能用於訓練輸出預設行為的模型。
  • 規範性正規化:不鼓勵標註者主觀性,試圖一致應用一種信念。優點是與標準NLP設定更一致,更容易透過衡量分歧或標籤聚合進行質量控制;缺點是建立高質量標註指南昂貴且具有挑戰性,且無法捕捉可解釋的信念多樣性或一致編碼特定信念。

資料質量與模型訓練

一旦資料集構建完成,許多方法可以根據訓練動態幫助識別錯誤標籤。我們只關注查詢和排除可能錯誤標籤資料點的方法,而不涉及如何在噪聲資料上訓練模型。

影響函式

影響函式是魯棒統計中的經典技術,透過描述模型引數隨訓練點微小加權變化來衡量訓練資料點的影響。Koh & Liang(2017)將其引入深度神經網路。

給定訓練集中的n個資料樣本,模型引數θ最佳化以最小化損失。移除單個資料點z的引數變化可以近似透過影響函式計算。透過影響函式,我們可以在封閉形式中衡量單個資料點對模型引數和損失函式的影響,有助於近似留一法再訓練而無需實際執行所有再訓練。為了識別錯誤標籤資料,可以測量I_up,loss(z_i, z_i),近似z_i從訓練集中移除時的預測誤差。

訓練過程中的預測變化

另一類方法是在訓練過程中跟蹤模型預測的變化,以識別似乎難以學習的案例。資料對映(Swayamdipta等人,2020)跟蹤訓練過程中模型行為動態的兩個屬性:

  • 置信度:模型對真實標籤的平均機率。
  • 變異性:置信度的標準差。

難以學習(低置信度、低變異性)的樣本更可能被錯誤標記。實驗發現,硬學習區域包含錯誤標籤樣本。但不應將所有難以學習的樣本視為錯誤。實際上,論文假設模糊(高變異性)和難以學習(低置信度、低變異性)的樣本對學習更有資訊量。

遺忘事件:Toneva等人(2019)設計實驗跟蹤每個樣本在訓練過程中的模型預測,並計數每個樣本從正確分類到錯誤分類的轉換次數。發現大量樣本一旦學習就永遠不會忘記。實驗驗證了這些“不可遺忘”樣本可以安全移除而不影響模型效能。

AUM(邊界下面積):Pleiss等人(2020)開發了AUM方法,基於梯度更新中泛化與錯誤預測之間的張力來識別錯誤標籤。對於誤標記樣本,其邊界會小於正確樣本。透過插入偽造的閾值樣本確定閾值。

噪聲交叉驗證

NCV方法隨機將資料集分成兩半,然後將標籤與僅基於另一半訓練的模型預測標籤匹配的資料樣本識別為“乾淨”。INCV迭代執行NCV,新增更多幹淨樣本。

本文總結了人類資料收集和清洗的多種方法,強調高質量資料的重要性,並提供實用的技術指導。

展開要點與分析

文章情報

工程師進階

要點

  • 高質量資料依賴細緻的人類標註流程,包括任務設計、標註員選擇和培訓。
  • 眾包聚合方法如多數投票和Cohen's Kappa可用於評估標註質量。
  • 描述性正規化鼓勵標註者主觀性,規範性正規化追求一致性,各有優缺點。
  • 影響函式、訓練動態和噪聲交叉驗證等ML技術可幫助識別資料中的錯誤標籤。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。