AI News HubLIVE
站内改写2 分钟阅读

一致并非对齐:人类与LLM伦理判断中的道德依据分歧

该研究通过包含500个ETHICS派生样本的基准,比较人类标注者与多种大语言模型在道德判断上的最终标签和理由。结果发现,模型与人类多数标签的一致性虽高,但理由层面存在系统性分歧:模型在伤害、尊重、守诺、正义、应得和借口相关性等类别上的关注分布与人类不同。作者认为,标签层面的一致性不能等同于对齐,仅依赖标签评估可能产生误导性信心。

来源arXiv AI作者: Octavian M. Machidon, Alina L. Machidon, Vojko Strahovnik, Mateja Centa Strahovnik, Jonas Miklav\v{c}i\v{c}, Marko Robnik \v{S}ikonja

大语言模型(LLM)的伦理对齐评估长期依赖一个直观的代理指标:模型与人类判断的一致性。然而,这种基于最终标签的一致性可能掩盖模型在道德推理方式上与人类的深层分歧。一篇由Octavian M. Machidon等人撰写的论文,以『一致并非对齐』为题,系统性地考察了这一问题。该论文于2026年7月14日提交至arXiv预印本平台,编号为arXiv:2608.12368,并已获得人工智能透明会议(AITC 2026)的接收,将于2026年6月5日至6日在德国纽伦堡进行展示。

研究的核心假设是:两个决策者得出同样的道德判断,并不代表他们依赖相同的道德理由或原则。为了检验这一假设,作者构建了一个经过精心筛选的基准测试集,包含500个项目,源自ETHICS数据集,覆盖了道德判断的五个典型领域。他们同时收集了人类标注者与多种主流开源及专有模型对这些样本的最终标签和支撑理由的标注。结果表明,在多数情况下,模型对样本给出的最终标签与人类标注者的多数意见高度一致。然而,当研究者深入分析标注理由时,发现了系统性的分歧。模型在理由中引用的道德范畴,如伤害、尊重、守诺、正义、应得与借口相关性等,其注意力分配与人类标注者显著不同,即便在最终标签一致时也是如此。

作者认为,这种差异揭示了一个重要问题:以标签一致性为衡量标准的对齐评估可能带来误导性的安全感。真正的对齐不仅要求输出相同的判断,还要求模型在推理过程中体现与人类相似的理由、原则和道德优先级。为此,论文建议在未来的评估中,除了检查最终答案,还应引入对理由和原则的分析,以更全面地判断模型是否真正与人类价值观对齐。

论文共计9页,包含4幅图表和3张表格,研究主题为人工智能(cs.AI)。论文的arXiv编号为2608.12368,DOI为10.48550/arXiv.2608.12368。该研究由Octavian M. Machidon与其他五位作者共同完成,其提交记录显示版本号v1,更新于2026年7月14日09:24 UTC。文章还附有HTML版本和TeX源码,供读者参考。由于该论文已被AITC 2026接收,它也在透明人工智能研究社区中引发了关于评估方法的讨论。这一工作提醒我们,在追求模型与人类伦理判断对齐的过程中,不能简单以“正确答案”的对错来衡量,而需要更细致地审视模型背后的道德推理过程。