标签
一个从使用工具的智能体蒸馏而来的2B视觉语言模型,通过剪枝其多语言嵌入表以满足参数限制,在长第一人称视频问答任务中取得了第一名,仅使用1.1%的参数就达到了更大管道89%的准确率。
ReMem提出了一种双层记忆增强的关键帧选择框架,用于免训练的长视频理解,在多个基准上实现了最先进的零样本性能。
本技术报告介绍了 Kwai Keye-VL-2.0,这是一个开源的混合专家多模态基础模型,专为长视频理解和智能体智能设计,利用 DeepSeek 稀疏注意力机制和跨模态蒸馏技术,在同等规模模型中实现了最先进的性能。
MemDreamer 通过分层图记忆和代理检索解耦长视频理解中的感知与推理,在降低计算开销的同时实现了最先进的性能。