cross-modal-reasoning

Tag

Cards List
#cross-modal-reasoning

MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models

arXiv cs.CL · 2026-06-05 Cached

MCBench is a new benchmark for assessing the safety of omnimodal large language models across vision, audio, and text modalities. It includes 1196 scenarios and finds current models struggle with cross-modal safety reasoning.

0 favorites 0 likes
#cross-modal-reasoning

Squeezing Capacity from Multimodal Large Language Models for Subject-driven Generation

Hugging Face Daily Papers · 2026-05-25 Cached

This paper proposes a novel approach that conditions diffusion models on Multimodal Large Language Models (MLLMs) for subject-driven image generation, using VAE-based identity conditioning and a Dual Layer Aggregation module to improve both semantic understanding and identity preservation while mitigating copy-paste artifacts.

0 favorites 0 likes
← Back to home

Submit Feedback