AI News HubLIVE
站內改寫2 分鐘閱讀

一致並非對齊:人類與LLM倫理判斷中的道德依據分歧

該研究透過包含500個ETHICS派生樣本的基準,比較人類標註者與多種大語言模型在道德判斷上的最終標籤和理由。結果發現,模型與人類多數標籤的一致性雖高,但理由層面存在系統性分歧:模型在傷害、尊重、守諾、正義、應得和藉口相關性等類別上的關注分佈與人類不同。作者認為,標籤層面的一致性不能等同於對齊,僅依賴標籤評估可能產生誤導性信心。

來源arXiv AI作者: Octavian M. Machidon, Alina L. Machidon, Vojko Strahovnik, Mateja Centa Strahovnik, Jonas Miklav\v{c}i\v{c}, Marko Robnik \v{S}ikonja

大語言模型(LLM)的倫理對齊評估長期依賴一個直觀的代理指標:模型與人類判斷的一致性。然而,這種基於最終標籤的一致性可能掩蓋模型在道德推理方式上與人類的深層分歧。一篇由Octavian M. Machidon等人撰寫的論文,以『一致並非對齊』為題,系統性地考察了這一問題。該論文於2026年7月14日提交至arXiv預印本平臺,編號為arXiv:2608.12368,並已獲得人工智慧透明會議(AITC 2026)的接收,將於2026年6月5日至6日在德國紐倫堡進行展示。

研究的核心假設是:兩個決策者得出同樣的道德判斷,並不代表他們依賴相同的道德理由或原則。為了檢驗這一假設,作者構建了一個經過精心篩選的基準測試集,包含500個專案,源自ETHICS資料集,覆蓋了道德判斷的五個典型領域。他們同時收集了人類標註者與多種主流開源及專有模型對這些樣本的最終標籤和支撐理由的標註。結果表明,在多數情況下,模型對樣本給出的最終標籤與人類標註者的多數意見高度一致。然而,當研究者深入分析標註理由時,發現了系統性的分歧。模型在理由中引用的道德範疇,如傷害、尊重、守諾、正義、應得與藉口相關性等,其注意力分配與人類標註者顯著不同,即便在最終標籤一致時也是如此。

作者認為,這種差異揭示了一個重要問題:以標籤一致性為衡量標準的對齊評估可能帶來誤導性的安全感。真正的對齊不僅要求輸出相同的判斷,還要求模型在推理過程中體現與人類相似的理由、原則和道德優先順序。為此,論文建議在未來的評估中,除了檢查最終答案,還應引入對理由和原則的分析,以更全面地判斷模型是否真正與人類價值觀對齊。

論文共計9頁,包含4幅圖表和3張表格,研究主題為人工智慧(cs.AI)。論文的arXiv編號為2608.12368,DOI為10.48550/arXiv.2608.12368。該研究由Octavian M. Machidon與其他五位作者共同完成,其提交記錄顯示版本號v1,更新於2026年7月14日09:24 UTC。文章還附有HTML版本和TeX原始碼,供讀者參考。由於該論文已被AITC 2026接收,它也在透明人工智慧研究社群中引發了關於評估方法的討論。這一工作提醒我們,在追求模型與人類倫理判斷對齊的過程中,不能簡單以“正確答案”的對錯來衡量,而需要更細緻地審視模型背後的道德推理過程。