vlm

标签

Cards List
#vlm

题目难度预测中视觉证据的表示:视觉文本化与图像原生建模

arXiv cs.CL · 4天前 缓存

本文研究了在数学评估中预测题目难度时应如何表示视觉证据,比较了仅文本、视觉文本化以及使用LLMs和VLMs的图像原生建模。研究发现,图像原生建模是文本化的有竞争力的替代方案,其性能取决于VLM的适配。

0 人收藏 0 人点赞
#vlm

仅用64个视觉token,460M VLM在iPhone上首token延迟降至0.3秒

Reddit r/LocalLLaMA · 5天前

VisionPsy-Nano-460M-Flash 是一款全新的460M视觉语言模型,每张图像仅使用64个视觉token,在iPhone上首token延迟降至0.3秒,同时保留了完整模型约99%的基准分数。这种优化牺牲了部分OCR和精细细节质量。

0 人收藏 0 人点赞
#vlm

@skalskip92: Qwen3.8-Max 是最佳目标检测 VLM - 卫星图像 - 红外图像 - 文档 - 技术图纸 - 手…

X AI KOLs Timeline · 6天前 缓存

一条推文声称 Qwen3.8-Max 是最佳目标检测 VLM,在卫星、红外、文档和手绘图像方面表现出色,并分享了示例。

0 人收藏 0 人点赞
#vlm

Hunyuan3D-Buffalo 1.0:面向可扩展3D生成、理解与编辑的统一多模态模型

Hugging Face Daily Papers · 2026-08-03 缓存

Hunyuan3D-Buffalo 1.0 是一个用于3D生成、理解与编辑的统一多模态模型,基于87M规模的3D多模态语料库进行训练。它结合了Hunyuan3D-VLM和Hunyuan3D-DiT,在文本到3D生成和3D编辑基准上取得了最先进的性能。

0 人收藏 0 人点赞
#vlm

VLMs 在基准测试中能取得高分,但同时会静默地抹去有意义的术语并引入幻觉偏差 [P]

Reddit r/MachineLearning · 2026-08-01

本文强调,用于胸部X光报告生成的 VLMs 在基准测试中能取得高分,但同时会抹去有临床意义的术语并引入有偏见的语言,并提出一个框架来度量这些失败。

0 人收藏 0 人点赞
#vlm

对抗性风格优化:基于GRPO的风格触发器优化增强VLM越狱攻击

arXiv cs.CL · 2026-07-27 缓存

本文发现多模态大语言模型(MLLMs)存在风格不一致性:其理解能力鲁棒,但安全机制可被风格触发器绕过。提出对抗性风格优化(ASO),利用GRPO微调图像编辑模型以增强越狱攻击。

0 人收藏 0 人点赞
#vlm

介绍 ASCIITermDraw Bench | 测试视觉语言模型生成和编辑 ASCII 艺术的能力

Reddit r/ArtificialInteligence · 2026-07-22

介绍 ASCIITermDraw Bench,这是一个用于评估视觉语言模型在 ASCII 艺术生成与编辑任务上的基准测试。

0 人收藏 0 人点赞
#vlm

HPD-Parsing:层次化并行文档解析

Hugging Face Daily Papers · 2026-07-21 缓存

HPD-Parsing 引入了一种面向基于VLM的文档解析的层次化并行解码范式,取代整页自回归生成,实现了每秒4752个令牌的吞吐量(比先前模型快2.62倍),同时保持了有竞争力的准确率。

0 人收藏 0 人点赞
#vlm

O-VAD:通过以对象为中心的跟踪与推理实现工业视频异常检测

Hugging Face Daily Papers · 2026-07-20 缓存

O-VAD 提出了一种无需训练的智能体框架,用于工业视频异常检测,该框架随时间跟踪对象状态演变,并在时间轨迹上进行推理以识别异常对象,在三个数据集上优于现有的 VLM 和 VAD 方法。

0 人收藏 0 人点赞
#vlm

面向交通管理的最小成本基础模型部署组合

arXiv cs.AI · 2026-07-16 缓存

本文提出了基础模型部署组合问题,旨在最小化跨交通管理职能部署LLM和VLM的总拥有成本,同时考虑质量、延迟和安全性约束。案例研究表明,与全闭源API基线相比,成本节省达97%。

0 人收藏 0 人点赞
#vlm

OvisOCR2 (0.8B): 首个登顶OmniDocBench的端到端模型——我用827份真实医学扫描文档测试了它,以下是我学到的所有内容

Reddit r/LocalLLaMA · 2026-07-15

OvisOCR2是一个0.8B参数的端到端文档解析视觉语言模型,在OmniDocBench排行榜上位居榜首,在实际扫描的医学文档上,其准确性和效率均优于流水线OCR系统。

0 人收藏 0 人点赞
#vlm

探索用于生成高质量数学可视化辅助的智能体工作流

arXiv cs.AI · 2026-07-14 缓存

本文介绍了一种智能体工作流,利用LLMs和VLMs迭代生成并改进面向K-12教育的高质量数学图表,填补了AI生成可视化辅助工具在可靠性方面的空白。

0 人收藏 0 人点赞
#vlm

GrAInS:基于梯度的归因方法用于大语言模型和视觉语言模型的推理时引导

arXiv cs.CL · 2026-07-13 缓存

GrAInS 是一种基于对比梯度的归因方法,利用积分梯度识别影响最大的词元,并构建引导向量,在推理时对大语言模型(LLM)和视觉语言模型(VLM)进行引导,从而提升真实性并减少幻觉,同时不损害流畅性。

0 人收藏 0 人点赞
#vlm

CLAP:通过语言-动作对齐实现从VLM到VLA的直接适配

arXiv cs.AI · 2026-07-13 缓存

CLAP提出了一种方法,通过将自然语言动作描述前置到动作标记序列中,将预训练的视觉-语言模型(VLM)转换为视觉-语言-动作模型(VLA),无需改变架构即可保留语义能力。该方法在LIBERO上达到90.8%,并提升了鲁棒性。

0 人收藏 0 人点赞
#vlm

TSRouter:用于时间序列推理的动态模态-模型选择

arXiv cs.LG · 2026-07-13 缓存

介绍TSRouter,一种基于图的动态路由框架,能够为时间序列推理任务选择最佳模态(LLM或VLM)和模型,相较于基线实现了16%到46%的相对改进,并展示了零样本泛化能力。

0 人收藏 0 人点赞
#vlm

@mylifcc: Sakana AI 联合 MIT/NYU 刚发了一篇重磅论文,提名了 GECCO 2026 最佳论文: 他们用 VLM 代理完整复现了经典的 Picbreeder 系统,来研究一个核心问题——开放式演化(Open-Endedness)到底…

X AI KOLs Timeline · 2026-07-12 缓存

Sakana AI联合MIT/NYU发布了一篇被提名GECCO 2026最佳论文的研究,使用VLM代理完整复现了经典Picbreeder系统,以探索开放式演化所需的关键成分。

0 人收藏 0 人点赞
#vlm

用于自动CAD生成的基础模型

arXiv cs.AI · 2026-07-08 缓存

本文全面实证研究了使用基础模型(大语言模型和视觉语言模型)从自然语言自动生成CAD的方法,提出了LLMForge框架,包含两种批评机制(IterTracer和IterVision),并在包含97个工程设计问题的基准上评估了七个模型。

0 人收藏 0 人点赞
#vlm

@yusuke_post: 我已发布源代码。https://github.com/shure-dev/small_vlm_video_analysis… 机制很简单:・预先…

X AI KOLs Timeline · 2026-07-07 缓存

该文章宣布开源发布 small_vlm_video_analysis,这是一个使用本地小型视觉语言模型的工具,用于验证程序化视频是否符合预定义的 SOP,包括帧描述、基于规则的判断以及可视化工具。

0 人收藏 0 人点赞
#vlm

PolicyShiftGuard:基准测试与改进策略自适应图像防护栏

Hugging Face Daily Papers · 2026-07-07 缓存

本文介绍了PolicyShiftBench(一个用于策略自适应图像防护栏的基准测试)以及PolicyShiftGuard(一个通过两阶段方法训练的紧凑模型,在安全策略变化时能提升性能)。

0 人收藏 0 人点赞
#vlm

@Prince_Canuma: mlx-vlm v0.6.4 来了!今天开始使用:> uv pip install -U mlx-vlm 5个新模型系列 — MiniMax M3、Kimi K2.5、Un…

X AI KOLs Timeline · 2026-07-06 缓存

mlx-vlm v0.6.4 已发布,支持5个新模型系列、TTS/STT端点,以及包括 TurboQuant 和连续批处理在内的重大性能改进。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈