标签
RRS-10K是一个用于评估视觉-语言模型在罕见遥感图像解读方面的基准数据集,包含超过10,000张军事相关图像和多种任务格式。对52个模型的评估显示其零样本性能中等,且在视觉定位和复杂推理方面存在明显不足。
UniSE 是一个统一的、无需提示的、自回归语音增强模型,基于纯解码器语言模型,支持单一模型内完成语音恢复、目标说话人提取和语音分离等多种任务。
MMAE是一个全面的多任务音频编辑基准,用于评估AI通过自然语言指令精确修改现有音频片段的能力,目前模型准确匹配率低于5%。
MMAE是一个全面的基于指令的音频编辑基准,涵盖多种模态和复杂度级别,揭示了当前模型能力中的显著差距。