AI News HubLIVE
站内改写1 分钟阅读

通过事实-启发式-情绪状态强制执行测量和提高大型语言模型的行为一致性

大型语言模型在不同运行中可能对同一问题给出不同答案,甚至根据自身先前答案反转决策。本研究提出认知内核模型(CKM),一种提示级别的状态强制执行层,要求模型在决策前将输入分为事实、启发式和情绪三类。在26个LLM上的实验表明,CKM显著降低了输出变异性(Hedges' g=1.09)和决策翻转率(高达82%),且效果随采样随机性增加而增强。但CKM并未提高推理正确性。

来源arXiv Computational Linguistics作者: Gi-Hun Lee, Joong Yull Park

大型语言模型(LLM)在多个运行中可能对同一决策问题给出不同答案,甚至会在自己的先前答案作为上下文返回时反转决策。这种不一致性引发了对其可靠性的担忧。一项新研究探讨了这种不稳定性是否可以在不改变模型权重的情况下被衡量和部分降低。

研究人员提出了认知内核模型(Cognitive Kernel Model, CKM),这是一种提示级别的状态强制执行层。在模型做出决策之前,它必须将输入分为三种认知角色:事实(给定或可验证的信息)、启发式(推断或假设的信息)和情绪(评价性或优先级信号)。CKM不增加任何能力,而是强制模型在行动前跟踪它使用何种类型的信息。形式上,它维护一个结构化状态 S_t = {F_t, H_t, E_t},由转换函数更新。

实验在韩语决策场景(包括模糊性、伦理冲突、资源分配和错误处理)下进行,涉及来自四个供应商的26个LLM和37,403个观测数据。研究包括四个核心实验、一个四臂消融实验、一个五臂假限制消融实验和一个温度探测。主要发现如下:

(1) CKM降低了重复输出的变异性(随机效应Hedges' g=1.09,95%置信区间[0.83, 1.35],31个模型对); (2) 状态持续性将较新模型的决策翻转率降低了82%(g=1.52); (3) 效果不仅仅来自JSON格式化(仅值重新计算,g=2.24); (4) 在固定锚定状态下,内在随机性可忽略; (5) 在采样随机性下优势增加(温度0.7时g=2.87); (6) 假限制消融显示约45%的增益来自结构框架,55%来自事实/启发式/情绪内容,且CKM是唯一同时提高一致性和降低翻转率的方案。

值得注意的是,CKM并不改进推理正确性。更狭窄的结论是:行为一致性是可测量的,在各模型间不同,并且可以通过强制模型在决策前分离事实、假设和评价性信号来部分改善。该研究提供了代码、提示和数据集,为进一步探索LLM行为一致性奠定了基础。