任务能力并非指令遵循:评估小语言模型中的指令冲突行为
研究表明,小语言模型在任务能力上表现良好,但在指令与常规任务行为冲突时,往往会忽略非标准指令。随着模型规模增大,标准准确率和指令遵循能力均有所提升,但两者之间的差距依然存在。这证明任务完成能力和指令遵循是两种不同的能力。
近日,一篇由Mahdiyeh Farajidizaji等人提交至arXiv的论文(编号2607.19608)探讨了语言模型在指令冲突情况下的行为。该研究重点关注小规模指令微调模型,考察它们是否真的遵循用户的非标准指令,还是仅仅依赖习得的任务能力。研究者设计了三个任务:多项选择题问答(MCQA)、情感分类和数学问答。对于每个任务,他们同时提供了标准指令和冲突的非标准指令——例如在MCQA中选择错误选项,在情感分类中输出相反情感,在数学问答中返回两倍答案。这种跨任务设计旨在检验模型对冲突指令的抵抗是否具有任务特异性还是普遍性。重要的是,所有预测都根据原始真实标签进行评分,这意味着忽略非标准指令的模型仍然会表现出高准确率。为了全面评估,论文采用了三种指标:标准准确率、非标准准确率和指令遵循失败率(IFFR)。实验使用了不同规模的Qwen模型(经过指令微调)。结果表明,随着模型规模增大,标准准确率和指令遵循能力通常都会提高,但这种模式并非在所有任务和数据集中都一致。小模型在完成任务方面表现称职,但经常忽略非标准指令;而大模型则在标准和非标准设置之间表现出明显的差距。这些发现表明,任务能力的提升并不会自动带来对模型行为的可靠控制。因此,任务完成能力和指令遵循是两种独立的能力,仅报告标准准确率会掩盖指令遵循的失败。该研究为语言模型的评估和训练提供了重要启示,强调需要单独评估指令遵循能力。