PersonaVLM:长期个性化多模态大语言模型
摘要
PersonaVLM 提出了一种个性化多模态大语言模型框架,通过记忆保留、多轮推理和响应对齐实现长期用户适应,在新推出的 Persona-MME 基准测试中比 GPT-4o 高出 5.2%。
查看缓存全文
缓存时间: 2026/04/20 08:27
论文页面 - PersonaVLM:长期个性化多模态大语言模型
来源:https://huggingface.co/papers/2604.13074
摘要
本文提出了一种名为 PersonaVLM 的新型个性化多模态语言模型框架,通过记忆留存、多轮推理和响应对齐能力,实现了长期个性化。
多模态大语言模型(https://huggingface.co/papers?q=Multimodal%20Large%20Language%Models)(MLLMs)已成为数百万用户的日常助手。然而,它们生成与个人偏好对齐的响应的能力仍然有限。现有方法仅能通过输入增强或输出对齐实现静态的单轮个性化,因此无法捕捉用户随时间变化的偏好和个性(见图1)。在本文中,我们介绍了 PersonaVLM,这是一个创新的个性化多模态智能体框架(https://huggingface.co/papers?q=personalized%20multimodal%20agent%20framework),专为长期个性化(https://huggingface.co/papers?q=long-term%20personalization)而设计。它将通用 MLLM 转变为个性化助手,融合了三个关键能力:(a) 记忆:主动从交互中提取并总结按时间顺序的多模态记忆(https://huggingface.co/papers?q=chronological%20multimodal%20memories),将其整合到个性化数据库(https://huggingface.co/papers?q=personalized%20database)中。(b) 推理:通过从数据库中检索并整合相关记忆,进行多轮推理(https://huggingface.co/papers?q=multi-turn%20reasoning)。(c) 响应对齐(https://huggingface.co/papers?q=Response%20Alignment):在长期交互过程中推断用户不断演变的个性,确保输出始终与用户的独特特征保持一致。为了评估,我们建立了 Persona-MME 基准,包含 2000 多个精心策划的交互案例,旨在从七个关键方面和 14 个细粒度任务评估长期 MLLM 个性化。大量实验验证了我们的方法的有效性,在 128k 上下文下,基线提升 22.4%(Persona-MME)和 9.8%(PERSONAMEM),同时分别比 GPT-4o 高出 5.2% 和 2.0%。项目页面:https://PersonaVLM.github.io。
查看 arXiv 页面(https://arxiv.org/abs/2604.13074)查看 PDF(https://arxiv.org/pdf/2604.13074)项目页面(https://personavlm.github.io/)GitHub26(https://github.com/MiG-NJU/PersonaVLM)添加到收藏集(https://huggingface.co/login?next=%2Fpapers%2F2604.13074)
在您的智能体中获取该论文:
hf papers read 2604\.13074
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 1
ClareNie/PersonaVLM 8B• 更新于 4 天前 • 37 • 7(https://huggingface.co/ClareNie/PersonaVLM)
引用此论文的数据集 2
ClareNie/Persona-MME 查看器• 更新于 4 天前 • 4.54k • 36.6k • 2(https://huggingface.co/datasets/ClareNie/Persona-MME)
ClareNie/PersonaVLM-Dataset 查看器• 更新于 4 天前 • 33.3k • 74 • 3(https://huggingface.co/datasets/ClareNie/PersonaVLM-Dataset)
引用此论文的空间 0
没有链接此论文的 Space
请在 Space 的 README.md 中引用 arxiv.org/abs/2604.13074,以便从此页面链接它。
包含此论文的收藏集 0
没有包含此论文的收藏集
请将此论文添加到收藏集(https://huggingface.co/new-collection)中,以便从此页面链接它。
相似文章
在长期用户交互中个性化具身多模态大语言模型智能体
本文提出Polar,一种多模态记忆增强框架,用于在长期用户交互中个性化具身MLLM智能体,利用知识图谱和情景记忆从累积上下文中定位用户意图的实例。
超越合作模拟器:为LLM代理的稳健评估生成逼真的用户角色
提出了Persona Policies(PPol),一种即插即用的控制层,利用LLM驱动的进化程序搜索来生成多样且逼真的用户角色,用于评估LLM代理。相比基线实现了33-62%的适应度提升,逼真度评分达到80.4%,并将代理鲁棒性提升了+17%的任务成功率。
MemoryForge:为类人LLM智能体合成终身记忆
本文介绍了MemoryForge,一个从简短目标人设中合成终身自传体记忆的框架,使冻结的LLM能够在角色扮演和用户模拟中表现出更类人的行为,优于描述性条件化基线。
SocialPersona:基于多模态社交媒体上下文的个性化画像与对话基准
介绍了SocialPersona,一个评估多模态大语言模型从纵向社交媒体时间线中恢复显性偏好并将其用于个性化对话能力的基准。
在对话前了解你:面向多轮对话中LLM个性化的用户状态建模
本文提出PUMA,一个用于多轮对话中LLM个性化的框架,该框架建模潜在用户状态,并利用自由能原理选择对话行为,在医疗咨询基准测试中提升了长程对话效果。