随机采样在认知上浅薄:LLM温度变化与模型多样性之间的维度差距
研究发现,通过温度采样重复运行单个LLM得到的答案变化(自一致性)只能揭示单一维度的结构,而使用多个不同模型的集成则能检测到更多跨问题的信号,从而更全面地揭示模型不知道的内容。
一篇新研究论文《随机采样在认知上浅薄:LLM温度变化与模型多样性之间的维度差距》探讨了大型语言模型(LLM)中不确定性估计的方法。该研究由Izhar Ali等人完成,已被EIML@ICML 2026接收。研究的核心问题是:当语言模型在重复运行时给出不同答案,这种变化是否能揭示模型不知道的内容?自一致性方法通过多数投票将这种变化转化为每个问题的不确定性估计,但它是否能像多样化的集成一样,揭示跨问题的结构——即相关问题是否同时翻转?
研究比较了两种方案:对同一组问题,将单个LLM在温度τ=1下运行100次,与24个不同LLM在温度τ=0下各运行一次组成集成。使用Marchenko-Pastur随机矩阵测试来分离信号和采样噪声。结果在五个模型家族和三个基准(MMLU、HellaSwag、GSM8K)上一致显示:任何单个模型最多只有一个维度高于噪声水平。相比之下,24个模型的集成则产生四个高于噪声边缘的特征值,而匹配难度的伯努利零假设在500次蒙特卡洛模拟中最多产生一个。
这表明,尽管自一致性(通过多数投票)能准确估算单个问题的置信度,但它无法揭示问题之间的结构相关性。只有通过多样化的模型集成,才能更全面地揭示模型不知道的内容。研究强调了集成方法在不确定性量化中的价值,并指出了温度采样作为多样性来源的局限性。该发现对模型选择、推理成本、产品能力和评估基准均有影响,提示从业者在需要深入理解模型知识边界时应优先考虑模型多样性而不是重复采样。