AI News HubLIVE
站內改寫1 分鐘閱讀

大型語言模型個性化能力的基準測試

本文提出了一種基於貝葉斯說服框架的LLM個性化能力評估方法,併發布了SDR-Bench資料集。實驗表明,當前最先進的LLM在個性化任務上存在一致性的效能瓶頸,無法顯著區分成功與失敗的銷售推廣。

來源arXiv AI作者: Ashutosh Srivastava, Siddharth Yedlapati, Vinay Aggarwal, Yaman Kumar Singla, Shashwat Dixit, Jitendra Ajmera, Balaji Krishnamurthy

個性化,即根據特定接收者調整資訊以促使其採取行動,是心理學和市場營銷中長期研究的雙主體問題。傳統方法受限於庫存約束,而大型語言模型(LLM)透過生成連續訊息變體突破了這一限制。然而,現有LLM個性化基準僅評估模型對同一使用者的適應性,忽略了接收者與傳送者目標獨立的關鍵場景。

為填補這一空白,研究者將Kamenica和Gentzkow(2011)的貝葉斯說服框架應用於生成式智慧體,並在銷售領域例項化。該框架透過對比生成資訊與其引發的接收者行為,評估個性化效果。基於此,團隊釋出了SDR-Bench,一個包含6,279個客戶成功故事的公開語料庫,涵蓋22個行業約200家企業,並透過時間約束模擬防止資料洩漏。

實驗對前沿LLM和深度研究智慧體進行測試,觀察到一致的個人化瓶頸:在《財富》100強科技企業中,沒有模型能夠統計上顯著區分成功與不成功的推廣資訊。現場部署中,12名專業銷售代表使用模型生成內容,48%的內容被評價為立即有用,與資深專家的評分一致性達到Pearson相關係數0.82。

團隊同時公開了SDR-Arena和SDR-Bench,以支援可重複的生成式個性化研究。該工作為評估和改進LLM的個性化能力提供了標準化基準,有望推動智慧銷售、個性化營銷等領域的實際應用。