多模型AI系统中的涌现协作审议:一种基于BFT的认知综合协议
提出Consilium协议,一种基于拜占庭容错的架构,用于多模型AI结构化审议。通过分配认知人物,低成本模型可达到前沿模型的分析质量,并揭示RLHF对齐带来的领域特定认知盲点。
我们提出了Consilium协议,这是一种源自拜占庭容错(BFT)的架构,用于结构化多模型AI审议,将模型间的分歧视为认知信号而非错误。该协议为语言模型分配工程化的认知人物——将模型是什么与其推理方式分开——并引入了从量化金融改编的样本内/样本外验证框架,以区分训练数据共识与经验性结论。在涵盖10个领域类别32个主题的1,478次审议会话中,我们证明:(1)认知人物而非底层模型决定认知行为:每次批处理成本仅为0.0002美元的自由边缘推理模型,其分析输出与成本为10.69美元的前沿模型相当;(2)RLHF对齐训练造成了可测量的、特定领域的认知盲点——有争议的政策主题比已确定的科学主题少12.3个百分点的对抗性挑战,AI安全主题表现出不对称偏见(Δ=11.6%),模型对“AI危险”主张的挑战远比对“AI风险被夸大”主张更为激烈;(3)该协议本身无方向性偏差(移民Δ=2.3%,可再生能源Δ=1.2%);(4)样本外证据检索以100%的检索率验证了239项主张,并发现了167个在训练数据审议中不可见的盲点发现。跨随机模型×人物分配的运行间可重复性平均标准差为±2.2%。包括所有开销在内的完整电池总成本为217美元。我们以MIT许可证发布协议规范,以实现独立验证。