基于真实行为特征的用户画像:个性化对齐与多视角推理
摘要
本文提出一个框架,通过分析社交媒体帖子提取基于真实行为特征的用户画像,以增强大语言模型的个性化对齐与多视角推理能力,其表现优于基于合成画像的方法。
查看缓存全文
缓存时间: 2026/09/02 05:42
# 基于真实行为数据构建的个性化对齐与多视角推理用户画像 来源:https://arxiv.org/abs/2609.00014 查看PDF(https://arxiv.org/pdf/2609.00014) > 摘要:角色驱动技术正日益将大型语言模型(LLM)适配于多样化场景。然而现有方法主要依赖僵化合成的角色画像,这类画像既会抹平个体差异、依赖刻板印象,又无法捕捉驱动真实人类偏好的微妙信号。我们提出"画像行为锚定"框架,该框架能直接从真实的匿名社交媒体帖子中提取开放式、高保真度的用户画像。我们在两种范式中评估这些画像:通过监督微调(SFT)实现训练时个性化,以及非参数化的测试时多视角推理。在复杂推荐和开放式查询基准测试中,行为锚定画像能持续提升基础模型表现,并优于合成画像基线方案,不仅实现了更强的参数化对齐,更支持了更丰富多维的推理。我们的研究证实:由行为衍生的开放式画像可作为下一代个性化语言系统高度多样且有效的基础。代码库已发布于:https://github.com/ServiceNow/behavior-grounding。 ## 提交历史 发件人:Yuxuan Li \[查看邮件(https://arxiv.org/show-email/83fb86fe/2609.00014)\] **\[版本1\]** 2026年8月11日(周二)10:19:11 UTC(12,494 KB)
相似文章
SocialPersona:基于多模态社交媒体上下文的个性化画像与对话基准
介绍了SocialPersona,一个评估多模态大语言模型从纵向社交媒体时间线中恢复显性偏好并将其用于个性化对话能力的基准。
基于角色的生成式AI多元对齐评估框架
本文提出了一种基于角色的评估框架,利用合成认知档案代表不同人类视角,用于生成式AI的多元对齐,解决了单一基准测试的局限性。
ProfileFoundry: 用于LLM智能体隐私、记忆与工具使用评估的合成人-对象基底
ProfileFoundry 引入了一个确定性的合成人-对象数据集,包含10万个档案和70万+事件,旨在评估LLM智能体在隐私、记忆和工具使用方面的表现,同时确保可检查性和一致性。
为测试面试对话系统生成多样化的用户模拟器角色
本文提出了一种方法,利用大型语言模型自动生成多样化的用户角色,用于测试面试对话系统,以减少人工努力并增加模拟用户行为的多样性。
LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs
This paper introduces LUNAR, a benchmark for evaluating how large language models personalize responses from longitudinal app interaction histories across daily-life domains such as clothing, food, housing, and mobility. Experiments on 19 mainstream LLMs reveal that effective personalization depends on evidence selection and cross-domain integration, and that stronger personalization can come at the cost of privacy protection.