高品質な人間データについて考える
高品質データは現代の深層学習モデル訓練の燃料です。ほとんどのタスク固有のラベル付きデータは人間のアノテーションに由来します。例えば、分類タスクやLLMのアライメント訓練のためのRLHFラベリング(分類形式として構成可能)などです。この記事では、人間によるアノテーションを通じて高品質データを収集する方法を探ります。
人間の評価者とデータ品質
人間データの収集には一連の運用ステップが含まれ、各ステップがデータ品質に貢献します:
- タスク設計:タスクのワークフローを設計し、明確性を高め、複雑性を低減します。詳細なガイドラインは役立ちますが、非常に長く複雑なガイドラインは十分な訓練を必要とします。
- 評価者の選定とトレーニング:スキルが一致し一貫性のあるアノテーターを選びます。トレーニングセッションが必要です。オンボーディング後、定期的なフィードバックとキャリブレーションセッションも必要です。
- データの収集と集約:この段階では、データをクリーン化、フィルタリング、スマートに集約して真のラベルを特定するために、より多くのML技術を適用できます。
群衆の知恵
「Vox populi」(ラテン語で「人民の声」)という言葉は、もともと1907年にNature誌に掲載された短い論文に由来します。この論文は、毎年恒例の展示会で肥えた牛が選ばれ、人々がその体重を推測し、実際の数値に近い場合に賞品を獲得するというイベントを追跡しました。中間の推定値(「vox populi」)は真の値に非常に近いことが判明しました。著者は「この結果は、民主的な判断の信頼性に対して予想されたよりも信用できるものだと思います」と結論付けました。これは、クラウドソーシング(「群衆の知恵」)がどのように機能するかについての最も初期の言及である可能性があります。
約100年後、Callison-Burch(2009)はAmazon Mechanical Turk(AMT)を使用して機械翻訳タスクの非専門家による人間評価を実行し、非専門家に新しいゴールドリファレンス翻訳を作成させる初期の研究を行いました。評価設定は単純で、各ワーカーにソース文、リファレンス翻訳、5つのMTシステムからの5つの翻訳が表示され、5つの翻訳を良い順にランク付けするよう求められました。各タスクは5人のワーカーによって完了されました。
当然のことながら、量だけを最適化するために低品質のアノテーションを生成するスパマーが存在します。そのため、専門家と非専門家の間の一致度を測定する際には、スパマーの貢献を低評価するために異なる重み付けスキームを適用する必要があります。
評価者間一致度
私たちはしばしば、アノテーションを単一のグラウンドトゥルースを対象とし、一貫した基準で1つのゴールドアンサーに対して品質を評価しようとします。信頼できるグラウンドトゥルースラベルを見つける一般的な方法は、複数の評価者から複数のラベルを収集することです。各評価者が異なる品質レベルでパフォーマンスを発揮すると仮定すると、熟練度スコアで重み付けされた加重平均を使用できます。このスコアは、多くの場合、ある評価者が他の評価者とどの程度一致するかによって近似されます。
- 多数決:ラベルのセットの最頻値を取る最も単純な集約方法。すべてのアノテーターが平等に貢献します。
- 生の一致度:他の人が自分に同意する割合をカウントします。
- Cohen's Kappa:評価者間一致度を測定し、偶然の一致を補正します。
- 確率的グラフモデリング:タスクの難易度、潜在トピック、評価者のバイアス、評価者の信頼度などの要因をモデル化し、真のラベルを予測します。
MACE(多アノテーター能力推定)は、誰かが「スパマー」のように振る舞う確率を推定するためにグラフモデリングを使用する初期の例です。
評価者の不一致と2つのパラダイム
上記の集約プロセスは、1つの根底にあるゴールドアンサーが存在するという仮定に依存しており、それに基づいてアノテーターのパフォーマンスを評価できます。しかし、多くのトピック、特に安全、社会、文化の分野では、人々は意見が分かれる可能性があり、この不一致はしばしば有効であり、厳格なルールを適用するのか、多様性を受け入れるのかという問題になります。
Aroyo & Welty(2015)は、人間アノテーション収集の実践における一連の「神話」を議論し、それらすべてがやや不正確であることを発見しました。重要な発見は次のとおりです:
- サンプルには複数の正しい解釈が存在することが多い。多様な視点が必要。
- 不一致は常に悪いとは限らない。エラーや設計不良による不一致は減らすべきだが、他の不一致は豊富な情報を提供する。
- タスクが適切に定義されていないことが原因なら、指示を強化すべき。しかし、より詳細なガイドラインでは意見の本質的多様性は解決できない。
- 専門家は常に素人より優れているとは限らないが、何が重要かを考慮する点では大きな差がある。
- グラウンドトゥルースアノテーションは時間とともに変化する可能性がある。
その後、Rottgerら(2021)は、主観的なNLPタスクのデータアノテーションにおける2つの対照的なパラダイムとしての違いを定式化しました。
- 記述的パラダイム:アノテーターの主観性を奨励し、多くの信念をモデル化しようとする。長所:より主観的なエントリを特定できる、多様性を受け入れる。短所:評価者間不一致をデータ品質やアノテーターパフォーマンスの測定に使用できない、1つの事前設定された行動を出力するように最適化されたモデルの訓練には使用できない。
- 規範的パラダイム:アノテーターの主観性を抑制し、一貫して1つの信念を適用しようとする。長所:標準的なNLP設定とより一致している、不一致の測定やラベル集約による品質管理が容易。短所:高品質なアノテーションガイドラインの作成は高価で困難、そして実践では完璧にはならない。
データ品質とモデル訓練
データセットが構築されると、多くの方法が訓練ダイナミクスに基づいて誤ラベルを特定するのに役立ちます。ここでは、潜在的に誤ったラベルを持つデータポイントを見つけて除外する方法にのみ焦点を当て、ノイズのあるデータでモデルを訓練する方法については扱いません。
影響関数
影響関数はロバスト統計の古典的な手法であり、訓練データポイントを微小量だけ重み付けしたときのモデルパラメータの変化を記述することで、訓練データポイントの効果を測定します。Koh & Liang(2017)はこの概念を深層ニューラルネットワークに適用しました。
訓練セット内のn個のデータサンプルが与えられると、モデルパラメータθは損失を最小化するように最適化されます。単一のデータポイントzを除去した後のモデルパラメータの変化は、影響関数を通じて近似できます。影響関数を使用して、閉じた形式で単一データポイントのモデルパラメータと損失関数への影響を測定でき、すべての再訓練を実際に実行せずに近似のleave-one-out再訓練を支援します。誤ラベルデータを特定するには、I_up,loss(z_i, z_i)を測定し、z_iを訓練セットから削除した場合の予測誤差を近似します。
訓練中の予測変化
別のクラスの方法は、訓練中のモデル予測の変化を追跡して、学習が難しいと思われるケースを特定することです。データマップ(Swayamdiptaら、2020)は、訓練中のモデル行動ダイナミクスの2つの属性を追跡します:
- 信頼度:真のラベルに対するモデルの平均確率。
- 変動性:信頼度の標準偏差。
学習困難(低信頼度、低変動性)なサンプルは誤ラベルである可能性が高いです。しかし、すべての学習困難サンプルを誤りと見なすべきではありません。実際、論文は曖昧(高変動性)および学習困難(低信頼度、低変動性)なサンプルは学習により有益であると仮定しています。
忘却イベント:Tonevaら(2019)は、訓練プロセス中に各サンプルのモデル予測を追跡し、各サンプルが正しく分類される状態から誤りに、またはその逆に遷移する回数をカウントする実験を設計しました。一度学習されると決して忘れられないサンプルが多数存在することがわかりました。実験では、これらの「忘れられない」サンプルはモデルのパフォーマンスを損なうことなく安全に削除できることが実証されました。
AUM(マージン下面積):Pleissら(2020)は、勾配更新における汎化と誤った予測の間の緊張に基づいて誤ラベルを特定するAUM法を開発しました。誤ラベルサンプルは正しいサンプルよりも小さなマージンを持つという仮説に基づいています。しきい値サンプルと呼ばれる偽のデータを挿入してしきい値を決定します。
ノイズ付き交差検証
NCV法はデータセットをランダムに半分に分割し、もう半分のデータセットのみで訓練されたモデルによって提供される予測ラベルとラベルが一致するデータサンプルを「クリーン」として識別します。INCVはNCVを反復的に実行し、より多くのクリーンサンプルを信頼できる候補セットに追加します。
この記事では、人間のデータ収集とクリーニングのさまざまな方法をまとめ、高品質データの重要性を強調し、実践的な技術的ガイダンスを提供します。