贝叶斯风洞用于模型选择
本研究探讨Transformer能否执行贝叶斯模型选择,即从数据中识别正确的假设类。通过引入贝叶斯风洞环境,使用固定点自由对合等控制设置,作者发现小型Transformer能在纯关系任务中实现接近贝叶斯最优的性能,但在需要算术运算时,使用不透明符号会彻底失败,且该边界在扩大模型规模后依然存在。对前沿LLM的探测显示其定性上符合贝叶斯行为,但校准差距较大。
大型语言模型(LLM)的核心能力之一是在不确定性下进行推理。先前工作已证明Transformer能在固定假设类内执行精确的贝叶斯滤波,但一个更根本的问题仍未解决:它们能否进行贝叶斯模型选择——即从数据中识别出正确的假设类?为此,arXiv:2607.19379论文提出了一种名为“模型选择贝叶斯风洞”的受控实验环境,其中可解析计算假设类上的真实后验分布。
研究者利用固定点自由对合(满足f(f(x))=x的纯关系函数)作为测试案例。一个仅含280万个参数的Transformer模型在整数和不透明符号两种 tokens 下,均实现了与贝叶斯最优解之间仅0.01比特的熵差异(三颗随机种子)。这一结果拓展至非嵌套比较:在对合与3循环(两者互无包含关系)的选择中,模型后验的平均绝对误差低于0.001,表明其超越了简单的简洁性或子集偏好,真正实现了模型选择。
然而,当判别统计量涉及算术运算时,情况截然不同。在模加法(旋转)或模乘法(f(x)=cx mod p)任务中,模型在使用整数tokens时成功进行模型选择,但使用不透明符号时完全失败。这一边界极为鲁棒:即使将模型参数从280万扩展至3.16亿(112倍扩大),失败模式依旧不变。对照实验表明,关键因素在于符号的稳定性:采用固定重标记的不透明tokens能够成功(熵平均绝对误差0.009位),说明稳定的语义而非整数的身份标识才是电路编译的基础。进一步的头部分理诊断将失败定位在头部求逆与算术的组合环节,而非头部解析本身。
最后,研究者测试了前沿的通用LLM(例如GPT-4级别模型)在相同任务上的表现。这些模型展现出定性的贝叶斯推理行为,但后验校准存在约55倍的显著差距(通过有损探针测量,故数值为方向性而非精确值)。该结果表明,当前通用LLM尚不具备与专用较小模型同等的贝叶斯模型选择能力。
这项工作揭示了Transformer在模型选择中的巨大潜力与关键局限,为构建更可靠、可解释的AI系统提供了重要见解。风洞方法也为未来研究提供了一个标准化评估框架。