标签
本文研究了在数学评估中预测题目难度时应如何表示视觉证据,比较了仅文本、视觉文本化以及使用LLMs和VLMs的图像原生建模。研究发现,图像原生建模是文本化的有竞争力的替代方案,其性能取决于VLM的适配。
VisionPsy-Nano-460M-Flash 是一款全新的460M视觉语言模型,每张图像仅使用64个视觉token,在iPhone上首token延迟降至0.3秒,同时保留了完整模型约99%的基准分数。这种优化牺牲了部分OCR和精细细节质量。
一条推文声称 Qwen3.8-Max 是最佳目标检测 VLM,在卫星、红外、文档和手绘图像方面表现出色,并分享了示例。
Hunyuan3D-Buffalo 1.0 是一个用于3D生成、理解与编辑的统一多模态模型,基于87M规模的3D多模态语料库进行训练。它结合了Hunyuan3D-VLM和Hunyuan3D-DiT,在文本到3D生成和3D编辑基准上取得了最先进的性能。
本文强调,用于胸部X光报告生成的 VLMs 在基准测试中能取得高分,但同时会抹去有临床意义的术语并引入有偏见的语言,并提出一个框架来度量这些失败。
本文发现多模态大语言模型(MLLMs)存在风格不一致性:其理解能力鲁棒,但安全机制可被风格触发器绕过。提出对抗性风格优化(ASO),利用GRPO微调图像编辑模型以增强越狱攻击。
介绍 ASCIITermDraw Bench,这是一个用于评估视觉语言模型在 ASCII 艺术生成与编辑任务上的基准测试。
HPD-Parsing 引入了一种面向基于VLM的文档解析的层次化并行解码范式,取代整页自回归生成,实现了每秒4752个令牌的吞吐量(比先前模型快2.62倍),同时保持了有竞争力的准确率。
O-VAD 提出了一种无需训练的智能体框架,用于工业视频异常检测,该框架随时间跟踪对象状态演变,并在时间轨迹上进行推理以识别异常对象,在三个数据集上优于现有的 VLM 和 VAD 方法。
本文提出了基础模型部署组合问题,旨在最小化跨交通管理职能部署LLM和VLM的总拥有成本,同时考虑质量、延迟和安全性约束。案例研究表明,与全闭源API基线相比,成本节省达97%。
OvisOCR2是一个0.8B参数的端到端文档解析视觉语言模型,在OmniDocBench排行榜上位居榜首,在实际扫描的医学文档上,其准确性和效率均优于流水线OCR系统。
本文介绍了一种智能体工作流,利用LLMs和VLMs迭代生成并改进面向K-12教育的高质量数学图表,填补了AI生成可视化辅助工具在可靠性方面的空白。
GrAInS 是一种基于对比梯度的归因方法,利用积分梯度识别影响最大的词元,并构建引导向量,在推理时对大语言模型(LLM)和视觉语言模型(VLM)进行引导,从而提升真实性并减少幻觉,同时不损害流畅性。
CLAP提出了一种方法,通过将自然语言动作描述前置到动作标记序列中,将预训练的视觉-语言模型(VLM)转换为视觉-语言-动作模型(VLA),无需改变架构即可保留语义能力。该方法在LIBERO上达到90.8%,并提升了鲁棒性。
介绍TSRouter,一种基于图的动态路由框架,能够为时间序列推理任务选择最佳模态(LLM或VLM)和模型,相较于基线实现了16%到46%的相对改进,并展示了零样本泛化能力。
Sakana AI联合MIT/NYU发布了一篇被提名GECCO 2026最佳论文的研究,使用VLM代理完整复现了经典Picbreeder系统,以探索开放式演化所需的关键成分。
本文全面实证研究了使用基础模型(大语言模型和视觉语言模型)从自然语言自动生成CAD的方法,提出了LLMForge框架,包含两种批评机制(IterTracer和IterVision),并在包含97个工程设计问题的基准上评估了七个模型。
该文章宣布开源发布 small_vlm_video_analysis,这是一个使用本地小型视觉语言模型的工具,用于验证程序化视频是否符合预定义的 SOP,包括帧描述、基于规则的判断以及可视化工具。
本文介绍了PolicyShiftBench(一个用于策略自适应图像防护栏的基准测试)以及PolicyShiftGuard(一个通过两阶段方法训练的紧凑模型,在安全策略变化时能提升性能)。
mlx-vlm v0.6.4 已发布,支持5个新模型系列、TTS/STT端点,以及包括 TurboQuant 和连续批处理在内的重大性能改进。