PersonaVLM:长期个性化多模态大语言模型

Hugging Face Daily Papers 论文

摘要

PersonaVLM 提出了一种个性化多模态大语言模型框架,通过记忆保留、多轮推理和响应对齐实现长期用户适应,在新推出的 Persona-MME 基准测试中比 GPT-4o 高出 5.2%。

多模态大语言模型(MLLMs)为数百万用户提供日常辅助。然而,它们生成符合个人偏好的响应的能力仍然有限。现有方法仅通过输入增强或输出对齐实现静态、单轮个性化,因此无法捕捉用户随时间变化的偏好和个性(见图1)。本文提出 PersonaVLM,一种创新的个性化多模态智能体框架,专为长期个性化设计。它将通用 MLLM 转变为个性化助手,集成了三个关键能力:(a)记忆:主动提取并总结交互中的时序多模态记忆,将其整合到个性化数据库中。(b)推理:通过检索和整合数据库中的相关记忆进行多轮推理。(c)响应对齐:在长期交互中推断用户不断变化的个性,确保输出与其独特特征保持一致。为了评估,我们建立了 Persona-MME 综合基准测试,包含超过 2000 个精心策划的交互案例,涵盖七个关键方面和 14 个细粒度任务,用于评估长期 MLLM 个性化。大量实验验证了该方法的有效性,在 128k 上下文下,将基线提升 22.4%(Persona-MME)和 9.8%(PERSONAMEM),同时分别比 GPT-4o 高出 5.2% 和 2.0%。项目页面:https://PersonaVLM.github.io。
查看原文
查看缓存全文

缓存时间: 2026/04/20 08:27

论文页面 - PersonaVLM:长期个性化多模态大语言模型

来源:https://huggingface.co/papers/2604.13074

摘要

本文提出了一种名为 PersonaVLM 的新型个性化多模态语言模型框架,通过记忆留存、多轮推理和响应对齐能力,实现了长期个性化。

多模态大语言模型(https://huggingface.co/papers?q=Multimodal%20Large%20Language%Models)(MLLMs)已成为数百万用户的日常助手。然而,它们生成与个人偏好对齐的响应的能力仍然有限。现有方法仅能通过输入增强或输出对齐实现静态的单轮个性化,因此无法捕捉用户随时间变化的偏好和个性(见图1)。在本文中,我们介绍了 PersonaVLM,这是一个创新的个性化多模态智能体框架(https://huggingface.co/papers?q=personalized%20multimodal%20agent%20framework),专为长期个性化(https://huggingface.co/papers?q=long-term%20personalization)而设计。它将通用 MLLM 转变为个性化助手,融合了三个关键能力:(a) 记忆:主动从交互中提取并总结按时间顺序的多模态记忆(https://huggingface.co/papers?q=chronological%20multimodal%20memories),将其整合到个性化数据库(https://huggingface.co/papers?q=personalized%20database)中。(b) 推理:通过从数据库中检索并整合相关记忆,进行多轮推理(https://huggingface.co/papers?q=multi-turn%20reasoning)。(c) 响应对齐(https://huggingface.co/papers?q=Response%20Alignment):在长期交互过程中推断用户不断演变的个性,确保输出始终与用户的独特特征保持一致。为了评估,我们建立了 Persona-MME 基准,包含 2000 多个精心策划的交互案例,旨在从七个关键方面和 14 个细粒度任务评估长期 MLLM 个性化。大量实验验证了我们的方法的有效性,在 128k 上下文下,基线提升 22.4%(Persona-MME)和 9.8%(PERSONAMEM),同时分别比 GPT-4o 高出 5.2% 和 2.0%。项目页面:https://PersonaVLM.github.io。

查看 arXiv 页面(https://arxiv.org/abs/2604.13074)查看 PDF(https://arxiv.org/pdf/2604.13074)项目页面(https://personavlm.github.io/)GitHub26(https://github.com/MiG-NJU/PersonaVLM)添加到收藏集(https://huggingface.co/login?next=%2Fpapers%2F2604.13074)

在您的智能体中获取该论文:

hf papers read 2604\.13074

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 1

ClareNie/PersonaVLM 8B• 更新于 4 天前 • 37 • 7(https://huggingface.co/ClareNie/PersonaVLM)

引用此论文的数据集 2

ClareNie/Persona-MME 查看器• 更新于 4 天前 • 4.54k • 36.6k • 2(https://huggingface.co/datasets/ClareNie/Persona-MME)

ClareNie/PersonaVLM-Dataset 查看器• 更新于 4 天前 • 33.3k • 74 • 3(https://huggingface.co/datasets/ClareNie/PersonaVLM-Dataset)

引用此论文的空间 0

没有链接此论文的 Space

请在 Space 的 README.md 中引用 arxiv.org/abs/2604.13074,以便从此页面链接它。

包含此论文的收藏集 0

没有包含此论文的收藏集

请将此论文添加到收藏集(https://huggingface.co/new-collection)中,以便从此页面链接它。

相似文章

超越合作模拟器:为LLM代理的稳健评估生成逼真的用户角色

arXiv cs.AI

提出了Persona Policies(PPol),一种即插即用的控制层,利用LLM驱动的进化程序搜索来生成多样且逼真的用户角色,用于评估LLM代理。相比基线实现了33-62%的适应度提升,逼真度评分达到80.4%,并将代理鲁棒性提升了+17%的任务成功率。

MemoryForge:为类人LLM智能体合成终身记忆

arXiv cs.CL

本文介绍了MemoryForge,一个从简短目标人设中合成终身自传体记忆的框架,使冻结的LLM能够在角色扮演和用户模拟中表现出更类人的行为,优于描述性条件化基线。