标签
本文提出GEAR(几何启用的注意力路由)框架,该框架利用几何作为视觉记忆的显式令牌级地址,以增强长时序相机控制视频生成,并达到最先进的成果。
本文提出VisKG-LM,一种将知识图谱编译为视觉记忆以进行高效多项选择题问答的方法,通过将图编码与语言推理解耦,在基线上实现性能提升。
一条推文,称赞 CollovLabs 在 AI 领域从单次识别到持久视觉记忆的进步。
介绍DMV-Bench,一个用于评估多模态智能体视觉记忆的交互式基准测试,该测试利用产品图像中的偶然视觉线索,并提出了DualMem,一种双编码记忆架构,在各种链长度上优于纯文本和其他多模态基线。