标签
本文提出一个框架,通过分析社交媒体帖子提取基于真实行为特征的用户画像,以增强大语言模型的个性化对齐与多视角推理能力,其表现优于基于合成画像的方法。
本文介绍了MirageBench,这是一个基准测试,表明具有持久记忆的LLM有35%至49%的时间通过过度推断虚构用户画像,并揭示模型自报的置信度与实际过度推断呈负相关,使得自我监控在比较模型时不可靠。
关于AI智能体应如何处理用户上下文的讨论:是主动告知还是逐步学习,现有的方法如项目记忆和聊天摘要均存在不足。
Ψ-Bench是一个基准测试,用于评估大语言模型通过对话影响用户的能力,并整合用户画像以进行个性化说服。实验表明,即使是最先进的模型仍有改进空间,而获取客户画像能显著提升性能。