RLHF偏好資料中的評分者狀態偏差:一個審計框架
該研究揭示了一種在人類反饋強化學習(RLHF)中存在的結構性混淆因素:評分者的心理狀態可能隨時間影響其偏好標籤,從而產生系統性偏差。論文提出了一個審計框架用於檢測這種偏差,並定義了相關概念、可證偽的預測和初步研究方案。
一篇新的研究論文審視了強化學習從人類反饋(RLHF)中一個可能被忽視的偏差來源:評分者狀態。論文由Elena Kopteva和Vitaliy Hlynianyi-Zhuk撰寫,於2026年4月14日提交至arXiv。研究指出,在標註過程中,評分者如果處於持續的壓力或困境中,其偏好可能會隨時間發生變化,從而使得偏好資料不僅包含對響應質量的判斷,還包含評分者的情緒狀態。這種狀態依賴的偏差不同於常規的分歧或隨機標籤噪聲,因為它可以在相似條件下工作的評分者之間共享,並有可能透過獎勵建模和策略最佳化傳播到最終的AI系統中。
為了應對這一挑戰,作者提出了一個“評分者狀態偏差”的假設,並開發了一套審計框架。該框架定義了三種關鍵概念:評分者狀態偏移(指評分者偏好的系統性變化)、評分者狀態混淆(指狀態與質量判斷的混合)以及相關性評分者狀態偏差(指多個評分者同時發生狀態偏差併產生系統性影響)。此外,論文引入了“生存級情緒真實性”作為可測量的響應模式,透過分析詞彙、語用、話語和與安全相關的特徵來識別。
研究人員推導了五個可證偽的預測,並設定了效應量閾值,以便進行初步審計。他們還概述了一個審計協議和試點研究計劃,該計劃可應用於公開可用的指令調優模型。需要注意的是,這項工作的目的並非推斷任何特定已部署模型的訓練歷史,而是將評分者狀態偏差作為一個合理且可測試的結構性偏差來源進行隔離研究。
這項研究為RLHF資料質量提供了新的視角,強調了標註過程中的心理因素可能對AI對齊產生重要影響。未來的工作可以基於該框架對現有和未來的偏好資料集進行審計,以減輕潛在的偏差風險。該論文的DOI為10.48550/arXiv.2607.16195,屬於人工智慧領域(cs.AI)。