video-language-models

标签

Cards List
#video-language-models

MoTE: 多任务视频理解中的任务专家混合

Hugging Face Daily Papers · 4天前 缓存

MoTE 在多任务视频理解中引入了任务特定的专家路由,以替代密集的解码器前馈网络,通过可解释的稀疏计算提高了准确性和效率。

0 人收藏 0 人点赞
#video-language-models

CLIP-CC-Bench: 评估视频-语言模型中的段落级视频描述

Hugging Face Daily Papers · 2026-08-05 缓存

介绍了CLIP-CC-Bench,一个用于评估视频-语言模型在电影片段段落级描述上的基准,包含200个片段和人工参考段落。测试了17个模型,发现长格式视频描述仍未解决。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈