更多並不是更好:LLM觀點多樣性的關鍵因素
一項新研究透過因子實驗挑戰了關於大型語言模型觀點多樣性的常見假設。研究顯示,增加人物細節並不能單調提升多樣性,不同互動架構探索非重疊的意見區域,組合多種架構比最佳化單一架構更有效。低成本方法如提高取樣溫度和新增多樣性指令效果甚微。
大型語言模型(LLM)越來越多地被用於模擬多樣的人類意見,例如在合成調查、焦點小組建模和民意預測中。然而,LLM的輸出存在系統性的意見同質化問題,即模型傾向於生成相似的觀點,缺乏真實人群中的多樣性。實踐者們嘗試了各種干預措施來增加多樣性,但這些方法往往被孤立地評估,且指標不可比,使得難以歸因提升效果。為了更科學地理解LLM輸出的多樣性,來自研究團隊的Qiyang Yao等人設計了一個因子實驗,分離了兩種主要的干預維度:輸入條件化(透過人物深度實現)和互動架構。他們在7個模型上評估了所有條件,使用100個真實使用者的開放性問題,並採用多種互補的多樣性指標。
研究結果挑戰了幾項常見假設。首先,更多的人物細節並不單調地增加多樣性。初始的人物條件化已經獲得了大部分增益,而進一步新增人口統計學細節並不一致地改善多樣性,甚至在某些模型上會降低多樣性。這意味著,與其花費精力構建詳細的角色檔案,不如專注於基本的角色設定。其次,研究者發現,與其尋找單一的最佳互動架構,不如組合使用多種架構,因為不同架構探索了很大程度上不重疊的意見區域。組合使用比最佳化任何一種單一架構能獲得更廣的覆蓋。例如,鏈式提示和樹式提示可能激發不同的觀點,聯合使用可以捕捉更全面的意見光譜。第三,常見的低成本替代方案,如提高取樣溫度和新增多樣性指令,與結構化干預相比效果甚微。這表明,要真正提升LLM輸出多樣性,需要系統性的設計而非簡單的引數調整。
總體而言,這項工作表明多樣性不是沿著單一維度縮放的結果,而是對干預的結構形式和組合高度敏感。這一發現對使用LLM進行社會模擬的研究人員具有重要啟示,強調了需要基於證據的多樣性增強策略。研究團隊計劃進一步探索不同人物設定和架構組合的協同效應,並開發自動化工具來最佳化多樣性。