标签
本文探讨了在多模态大型语言模型中,冲突证据的顺序对判断的影响,揭示了跨模态证据非交换性:当感知证据置于较后位置时,模型对其的依赖性会增强。
本文提出了一种针对扩散视觉语言模型的轨迹感知解码控制方法,通过根据解码状态路由样本来解决推理预算不匹配问题,从而提高跨基准测试的鲁棒性。
本文提出了一种损伤感知的多臂老虎机方法,用于视觉和语言Transformer的结构化训练后剪枝。实验表明,与基线方法相比,该方法在多种模型和数据集上表现出降低的性能下降。
Ling-3.0-flash-VL 是 inclusionAI 新发布的多模态 AI 模型,具有原生图像和视频理解功能,采用 124B 参数架构,其中 5.5B 参数为活跃参数,支持 1M token 上下文,并采用 MIT 许可证。
LLaDA-UI是一个拥有16.7B参数的专家混合扩散视觉-语言智能体,通过块并行解码效率实现强大的多模态GUI性能,在基准测试中优于现有模型。
Qwen-Drive-1.0 是一个用于自动驾驶的视觉语言基础模型,它在一个统一框架中整合了3D感知、视觉问答和运动规划,在基准测试中表现出色。
ZDTaichu5.0-9B 是一个多模态基础模型,结合了 Qwen3.5-9B 语言骨架和 C-RADIOv4-H 视觉编码器,在10B规模的视觉语言模型中擅长一般视觉理解、空间推理和代理任务。
LLaDA-Image 提出了一个统一框架,结合了一个 60 亿参数的扩散变换器和一个冻结的视觉语言模块,用于生成具有精确编辑功能的逼真图像,通过高效的训练和快速推理,在开源模型中达到了最先进的成果。
SlideBank 是一个用于病理学中全切片图像推理的免训练框架,通过使用持久化分层证据库来提高一致性并降低推理成本。
MedTVL是一种文本引导的双路径架构,用于医学时间序列分类,它协同时间模态和视觉模态与文本语义,在各种学习设置中展示优越性。
Qwen-Drive-1.0是一款面向自动驾驶的视觉语言基础模型,通过共享表征与分阶段训练,统一了三维感知、视觉问答和运动规划能力。
本文描述了Z.ai的GLM-5.3-Flash模型的无审查版本,通过abliteration移除了安全对齐,作为block-FP8检查点发布,用于研究目的。
本文介绍了一个用于大型视觉语言模型(LVLMs)中交互式视觉定位的受控评估框架,表明当前LVLMs的表现低于人类基线,并在主动问题驱动定位方面存在困难。
本文比较了视觉-语言数学推理中稀疏奖励强化学习的先验注入方法,发现其有效性取决于传递方式,并且某些评估切片可能会误导泛化评估。
Qwen3.8-27B-Uncensored 是一个拥有270亿参数的AI模型,通过abliteration技术移除了安全对齐,并已在Hugging Face上发布供研究用途,且无内置防护。
本文在多语言MLLMs中识别出Ghost Anchor现象,即视觉信号在早期对齐阶段未被充分利用,并提出ANCHOR训练框架以提升视觉语义涌现和跨语言性能。
这是一个针对 Apple Silicon 量化的 Qwen Qwen3.8-27B 模型的无审查 MLX 构建,移除了安全对齐用于研究目的。
这是Qwen3.8-27B的修改版本,移除了安全拒绝机制并进行了FP8量化,专为AI安全性和可解释性研究设计。
Qwen 3.8 27B 模型已推出 NVFP4 量化版本,使其能在单个 RTX 5090 GPU 上运行,并在编码、智能任务和视觉语言理解方面有所增强。
Qwen 发布了 Qwen3.8-27B,这是一个开放权重的 27B 稠密视觉语言模型,在编程、专业工作和长周期智能体任务上取得了重大进展,提供 FP8 版本并支持灵活的思考控制。