任務能力並非指令遵循:評估小語言模型中的指令衝突行為
研究表明,小語言模型在任務能力上表現良好,但在指令與常規任務行為衝突時,往往會忽略非標準指令。隨着模型規模增大,標準準確率和指令遵循能力均有所提升,但兩者之間的差距依然存在。這證明任務完成能力和指令遵循是兩種不同的能力。
近日,一篇由Mahdiyeh Farajidizaji等人提交至arXiv的論文(編號2607.19608)探討了語言模型在指令衝突情況下的行為。該研究重點關注小規模指令微調模型,考察它們是否真的遵循用户的非標準指令,還是僅僅依賴習得的任務能力。研究者設計了三個任務:多項選擇題問答(MCQA)、情感分類和數學問答。對於每個任務,他們同時提供了標準指令和衝突的非標準指令——例如在MCQA中選擇錯誤選項,在情感分類中輸出相反情感,在數學問答中返回兩倍答案。這種跨任務設計旨在檢驗模型對沖突指令的抵抗是否具有任務特異性還是普遍性。重要的是,所有預測都根據原始真實標籤進行評分,這意味着忽略非標準指令的模型仍然會表現出高準確率。為了全面評估,論文采用了三種指標:標準準確率、非標準準確率和指令遵循失敗率(IFFR)。實驗使用了不同規模的Qwen模型(經過指令微調)。結果表明,隨着模型規模增大,標準準確率和指令遵循能力通常都會提高,但這種模式並非在所有任務和數據集中都一致。小模型在完成任務方面表現稱職,但經常忽略非標準指令;而大模型則在標準和非標準設置之間表現出明顯的差距。這些發現表明,任務能力的提升並不會自動帶來對模型行為的可靠控制。因此,任務完成能力和指令遵循是兩種獨立的能力,僅報告標準準確率會掩蓋指令遵循的失敗。該研究為語言模型的評估和訓練提供了重要啓示,強調需要單獨評估指令遵循能力。