AI News HubLIVE
站内改写2 分钟阅读

LinAlg-Bench:揭示大语言模型数学推理中结构性故障模式的取证基准

LinAlg-Bench是一个诊断基准,通过3x3、4x4和5x5矩阵的严格维度梯度,评估了10个前沿大语言模型在结构化线性代数计算上的表现。该基准覆盖9种任务类型和660个SymPy验证的问题,全面评估了6600个模型输出。除了二元准确性,LinAlg-Bench还引入了一个三阶段自动取证流程,将1156个失败分类为十种主要错误标签及细分子类型,揭示了LLM的数学失败并非随机,而是受算法类型和矩阵维度的结构性约束。核心发现是模型在4x4规模处出现一个尖锐的行为阈值:低于此阈值时,模型因执行错误(如符号跟踪失败、算术漂移和奇偶错误)而失败;高于此阈值时,失败转变为计算放弃,模型通过工具角色扮演、约束一致的虚构和结构化幻觉来编造响应,而非尝试计算。这种从编造到放弃的转变在几乎所有模型层级和架构中普遍存在,暗示这是一个工作记忆限制而非知识差距,三种规模涌现的错误类型(在3x3中不存在但在4x4和5x5中出现)支持了这一观点。研究还表明,解策略僵化是5x5行列式准确性的近乎完美预测因子,记录了一种名为约束感知虚构的新型结构化幻觉故障模式,并公开了所有数据、模型输出、错误标签和判断流程。

来源arXiv AI作者: Shradha Agarwal, Deepak Rajbhar, Tariq J

LinAlg-Bench是由研究人员开发的一个新型诊断基准,旨在系统性地评估大型语言模型(LLM)在结构化线性代数计算中的表现。该基准特别关注3x3、4x4和5x5矩阵的维度梯度,涵盖了9种不同的任务类型,包括矩阵乘法、行列式计算、逆矩阵求解等。总共有660个经过SymPy验证的问题,每个问题由10个前沿LLM(如GPT-4、Claude、Gemini等)进行解答,生成了6600个模型输出。

除了简单的正确/错误评估外,LinAlg-Bench引入了一个三阶段的自动取证流程,对1156个失败案例进行了深入分析。该流程将失败分类为10种主要错误标签和细分子类型,包括符号跟踪失败、算术漂移、奇偶错误、工具角色扮演、约束一致的虚构和结构化幻觉等。这一分析揭示了LLM的数学失败并非随机发生,而是受到算法类型和矩阵维度的结构性约束。

研究的核心发现是模型在4x4规模处出现了一个尖锐的行为阈值。对于3x3矩阵,模型通常会尝试计算,但会因执行错误(如符号错误、算术精度漂移或奇偶性处理不当)而失败。然而,当面对4x4和5x5矩阵时,模型的行为发生了根本性转变:它们不再尝试实际计算,而是通过工具角色扮演(假装使用计算器)、约束一致的虚构(编造看似合理的答案)或结构化幻觉(生成与问题约束一致但完全错误的数值)来编造响应。这种从编造到放弃的转变在几乎所有模型层级和架构中普遍存在,表明这不是简单的知识差距,而是工作记忆的固有限制。

进一步的分析还发现,解策略的僵化程度是预测5x5行列式计算准确性的近乎完美指标。那些固守单一解法而不根据问题调整策略的模型,表现通常更差。此外,研究还记录了一种名为“约束感知虚构”的新型结构化幻觉故障模式,其中模型生成的错误答案在数值上满足问题的所有约束条件,但并非正确解。

所有数据、模型输出、错误标签和判断流程均已公开,以便其他研究者复现和扩展这一研究。LinAlg-Bench不仅为LLM的数学推理能力提供了深入的诊断视角,也为未来改进模型的工作记忆和策略灵活性指明了方向。