AI News HubLIVE
站内改写1 分钟阅读

大型语言模型个性化能力的基准测试

本文提出了一种基于贝叶斯说服框架的LLM个性化能力评估方法,并发布了SDR-Bench数据集。实验表明,当前最先进的LLM在个性化任务上存在一致性的性能瓶颈,无法显著区分成功与失败的销售推广。

来源arXiv AI作者: Ashutosh Srivastava, Siddharth Yedlapati, Vinay Aggarwal, Yaman Kumar Singla, Shashwat Dixit, Jitendra Ajmera, Balaji Krishnamurthy

个性化,即根据特定接收者调整信息以促使其采取行动,是心理学和市场营销中长期研究的双主体问题。传统方法受限于库存约束,而大型语言模型(LLM)通过生成连续消息变体突破了这一限制。然而,现有LLM个性化基准仅评估模型对同一用户的适应性,忽略了接收者与发送者目标独立的关键场景。

为填补这一空白,研究者将Kamenica和Gentzkow(2011)的贝叶斯说服框架应用于生成式智能体,并在销售领域实例化。该框架通过对比生成信息与其引发的接收者行为,评估个性化效果。基于此,团队发布了SDR-Bench,一个包含6,279个客户成功故事的公开语料库,涵盖22个行业约200家企业,并通过时间约束模拟防止数据泄漏。

实验对前沿LLM和深度研究智能体进行测试,观察到一致的个人化瓶颈:在《财富》100强科技企业中,没有模型能够统计上显著区分成功与不成功的推广信息。现场部署中,12名专业销售代表使用模型生成内容,48%的内容被评价为立即有用,与资深专家的评分一致性达到Pearson相关系数0.82。

团队同时公开了SDR-Arena和SDR-Bench,以支持可重复的生成式个性化研究。该工作为评估和改进LLM的个性化能力提供了标准化基准,有望推动智能销售、个性化营销等领域的实际应用。