来源:ArXiv AI 2026-07-24 04:00

对大型语言模型的个性化能力进行基准测试

模型 个性化 生成 接收者 研究
arXiv:2607.20471v1 公告类型:新 摘要:个性化是在保持发送者、渠道和时间固定的情况下改变消息以诱导特定接收者采取行动的行为,作为发送者和接收者具有独立目标的两方问题,在心理学和市场营销中具有悠久的传统。大型语言模型通过生成以推断的接收者状态为条件的消息变体的连续体,消除了经典检索和排序方法的有限库存约束,从而提出了当前模型在经典意义上执行个性化的效果如何的问题。现有的 LLM 个性化基准衡量发送方的适应性,其中接收方是模型所服务的同一用户。两方问题,即生成的消息是否会在第三方中引发其预期行为,仅通过 A/B 测试和小规模人体研究进行了调查,而这些研究无法根据需要针对新模型重新运行。我们将 Kamenica 和 Gentzkow (2011) 的贝叶斯说服框架应用于生成代理,并在销售中实例化该公式,其中接收者的行为会根据诱导他们的外展定期记录。我们发布了 SDR-Bench,这是一个公共语料库,包含 22 个行业和大约 200 家企业的 6,279 个客户成功案例,通过临时受限模拟提供服务,以防止未来数据泄漏。在前沿法学硕士和深度研究代理中,我们观察到一致的个性化平台,并且在财富 100 强技术队列中,没有模型可以在统计上区分成功和不成功的推广。由 12 名专业销售代表进行的现场部署验证了该框架,48% 的模型生成内容被评为立即有用且高级专家一致认为 Pearson 0.82。我们公开发布 SDR-Arena 和 SDR-Bench,以支持大规模生成个性化的可重复研究。

相关文章推荐

返回首页