multitask

Tag

Cards List
#multitask

RRS-10K: A Multitask Vision-Language Model Benchmark for Rare Remote Sensing Image Interpretation

arXiv cs.AI · 2026-07-29 Cached

RRS-10K is a benchmark dataset for evaluating vision-language models on rare remote sensing image interpretation, containing over 10,000 military-related images and multiple task formats. Evaluation of 52 models reveals moderate zero-shot performance and weaknesses in visual grounding and complex reasoning.

0 favorites 0 likes
#multitask

@multimodalart: UniSE: Unified Speech Enhancement high quality open source model for making an audio crisp & isolating speakers in mult…

X AI KOLs Following · 2026-07-07 Cached

UniSE is a unified, prompt-free, autoregressive speech enhancement model based on a decoder-only language model, supporting multiple tasks like speech restoration, target speaker extraction, and speech separation in a single model.

0 favorites 0 likes
#multitask

@TencentHunyuan: Can AI truly edit audio, not just generate it? Tencent Hy, in collaboration with SJTU, SII, NTU, TJU, ZODA, PKU, FDU, a…

X AI KOLs Timeline · 2026-06-08 Cached

MMAE is a comprehensive benchmark for multitask audio editing that evaluates AI's ability to precisely modify existing audio clips via natural language instructions, with current models achieving under 5% exact match rate.

0 favorites 0 likes
#multitask

MMAE: A Massive Multitask Audio Editing Benchmark

Hugging Face Daily Papers · 2026-06-05 Cached

MMAE is a comprehensive benchmark for instruction-based audio editing across multiple modalities and complexity levels, revealing significant gaps in current model capabilities.

0 favorites 0 likes
← Back to home

Submit Feedback