multitask

标签

Cards List
#multitask

RRS-10K:面向罕见遥感图像解读的多任务视觉-语言模型基准

arXiv cs.AI · 2026-07-29 缓存

RRS-10K是一个用于评估视觉-语言模型在罕见遥感图像解读方面的基准数据集,包含超过10,000张军事相关图像和多种任务格式。对52个模型的评估显示其零样本性能中等,且在视觉定位和复杂推理方面存在明显不足。

0 人收藏 0 人点赞
#multitask

@multimodalart: UniSE:统一语音增强的高质量开源模型,用于使音频清晰并分离多人对话中的说话者……

X AI KOLs Following · 2026-07-07 缓存

UniSE 是一个统一的、无需提示的、自回归语音增强模型,基于纯解码器语言模型,支持单一模型内完成语音恢复、目标说话人提取和语音分离等多种任务。

0 人收藏 0 人点赞
#multitask

@TencentHunyuan: AI真的能编辑音频,而不仅仅是生成吗?腾讯混元与SJTU、SII、NTU、TJU、ZODA、PKU、FDU等单位合作,推出……

X AI KOLs Timeline · 2026-06-08 缓存

MMAE是一个全面的多任务音频编辑基准,用于评估AI通过自然语言指令精确修改现有音频片段的能力,目前模型准确匹配率低于5%。

0 人收藏 0 人点赞
#multitask

MMAE:一个大规模多任务音频编辑基准

Hugging Face Daily Papers · 2026-06-05 缓存

MMAE是一个全面的基于指令的音频编辑基准,涵盖多种模态和复杂度级别,揭示了当前模型能力中的显著差距。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈