AI News HubLIVE
站內改寫1 分鐘閱讀

大型語言模型個性化能力的基準測試

本文提出了一種基於貝葉斯説服框架的LLM個性化能力評估方法,併發布了SDR-Bench數據集。實驗表明,當前最先進的LLM在個性化任務上存在一致性的性能瓶頸,無法顯著區分成功與失敗的銷售推廣。

來源arXiv AI作者: Ashutosh Srivastava, Siddharth Yedlapati, Vinay Aggarwal, Yaman Kumar Singla, Shashwat Dixit, Jitendra Ajmera, Balaji Krishnamurthy

個性化,即根據特定接收者調整信息以促使其採取行動,是心理學和市場營銷中長期研究的雙主體問題。傳統方法受限於庫存約束,而大型語言模型(LLM)通過生成連續消息變體突破了這一限制。然而,現有LLM個性化基準僅評估模型對同一用户的適應性,忽略了接收者與發送者目標獨立的關鍵場景。

為填補這一空白,研究者將Kamenica和Gentzkow(2011)的貝葉斯説服框架應用於生成式智能體,並在銷售領域實例化。該框架通過對比生成信息與其引發的接收者行為,評估個性化效果。基於此,團隊發佈了SDR-Bench,一個包含6,279個客户成功故事的公開語料庫,涵蓋22個行業約200家企業,並通過時間約束模擬防止數據泄漏。

實驗對前沿LLM和深度研究智能體進行測試,觀察到一致的個人化瓶頸:在《財富》100強科技企業中,沒有模型能夠統計上顯著區分成功與不成功的推廣信息。現場部署中,12名專業銷售代表使用模型生成內容,48%的內容被評價為立即有用,與資深專家的評分一致性達到Pearson相關係數0.82。

團隊同時公開了SDR-Arena和SDR-Bench,以支持可重複的生成式個性化研究。該工作為評估和改進LLM的個性化能力提供了標準化基準,有望推動智能銷售、個性化營銷等領域的實際應用。