AI News HubLIVE
站內改寫1 分鐘閱讀

AI最喜歡的數字

當要求AI在1到10之間生成隨機數時,它傾向於選擇7,這與人類的偏見相似。這種偏差源於AI從人類資料中學習。在評估任務中,使用連續評分(如10分制)會受到同樣偏差的影響,導致評分失真。本文建議使用二元真假問題來構建評估套件,並透過加權求和得到連續分數,從而避免偏差。此外,可以使用Yeo-Johnson變換等方法來歸一化分數分佈,提高下游模型的準確性。

來源Hacker News AI作者: sackfield

當人們被要求說出一個1到10之間的隨機數時,大多數人會選擇7。這種人類偏見如今在AI身上也得到了體現。研究者發現,當讓大型語言模型(LLM)生成1到10之間的隨機數時,它們也傾向於輸出7,分佈與人類行為高度相似。這並非偶然,而是因為LLM基於人類產生的資料進行訓練,從而複製了人類材料中的分佈偏差。類似的偏差還出現在產品評分中:使用者通常給出4顆星(滿分5星),導致評分分佈呈J形。這種模式在Google餐廳評論和Uber司機評分中也普遍存在。

這種偏差如何影響AI評估?假設你使用LLM-as-a-judge來評估智慧體的任務完成質量,並要求模型以10分制打分。你會發現,得到的分數分佈並非均勻,而是集中在7分附近——但這並不意味著程式碼質量優秀,而是反映了模型內部的偏好。實際上,7分可能代表平均水平。一個簡單的實驗證實了這一點:讓LLM對GitHub上的隨機程式碼片段以10分制評分,100個樣本的結果顯示,分佈明顯偏向7。不僅如此,如果使用多項選擇,LLM還傾向於選擇第一個選項,這同樣是偏差的表現。

為了解決這個問題,作者建議將評估分解為一系列二元真假問題。例如,在程式碼評估中,可以問“程式碼結構是否良好?”、“意圖是否清晰?”、“錯誤處理是否恰當?”。透過為每個問題分配權重並求和,可以得到一個連續分數。這種方法不僅避免了分佈偏差,還使評分過程透明且可追溯。實際上,二進位制是計算機的基礎,包括LLM本身也不例外。最後,作者指出,瞭解評分分佈至關重要。如果需要進一步最佳化,可以使用Yeo-Johnson變換等工具對分數進行歸一化,使其分佈平滑,從而為下游模型提供更好的梯度。總之,二元分解和分佈控制是構建可靠AI評估系統的關鍵。