AI News HubLIVE
サイト内リライト2 分で読了

大規模言語モデルのパーソナライゼーション能力のベンチマーキング

本論文は、ベイズ説得フレームワークを応用したLLMのパーソナライゼーション能力評価手法を提案し、SDR-Benchデータセットを公開。最先端のLLMにおいて一貫したパフォーマンスの頭打ちを観測し、営業現場での実証実験によりフレームワークの有効性を確認した。

ソースarXiv AI著者: Ashutosh Srivastava, Siddharth Yedlapati, Vinay Aggarwal, Yaman Kumar Singla, Shashwat Dixit, Jitendra Ajmera, Balaji Krishnamurthy

パーソナライゼーションは、メッセージを特定の受信者に合わせて変化させ、行動を誘発する行為であり、心理学やマーケティングにおいて長い伝統を持つ二主体問題である。大規模言語モデル(LLM)は、推論された受信者状態に基づいてメッセージの連続的なバリアントを生成することで、従来の検索・ランキング手法の在庫制約を取り除き、現在のモデルが古典的な意味でどの程度パーソナライゼーションを実行できるかという疑問を提起する。

既存のLLMパーソナライゼーションベンチマークは、送信者側の適応(モデルがサービスしているユーザーが受信者となる場合)のみを測定していた。生成されたメッセージが第三者に意図した行動を誘発するかという二主体の問題は、A/Bテストや小規模な人間による研究でのみ調査され、新しいモデルに対してオンデマンドで再実行することはできなかった。

本研究では、Kamenica and Gentzkow(2011)のベイズ説得フレームワークを生成エージェントに適用し、受信者の行動が定期的に記録される営業分野で定式化を具体化した。SDR-Benchという、22業界、約200企業にわたる6,279件の顧客成功事例からなる公開コーパスをリリースし、将来のデータ漏洩を防ぐ時間制約付きシミュレーションを通じて提供する。

最先端のLLMと深層研究エージェントに対して実験を行った結果、一貫したパーソナライゼーションの頭打ちが観察され、Fortune 100のテクノロジーコホートでは、成功したアウトリーチと失敗したアウトリーチを統計的に分離できるモデルはなかった。12人のプロの営業担当者による現場展開によりフレームワークが検証され、モデル生成コンテンツの48%が即座に有用と評価され、シニアエキスパートとの一致はピアソン相関係数0.82であった。SDR-ArenaとSDR-Benchを公開し、生成型パーソナライゼーションの再現可能な大規模研究を支援する。