标签
Aloe-Vision 引入了一系列开放的医学视觉-语言模型,这些模型在经质量过滤的医学与通用数据混合集上训练,同时提供了用于可靠评估的新基准 CareQA-Vision。这些模型展现出具有竞争力的性能,同时也揭示了在对抗性输入面前的脆弱性。
Chunkr 是一个开源文档智能服务,将 PDF、PPT、Word 文档和图像转换为结构化块,用于 RAG 和 LLM 流水线。它具有 OCR 布局分析、结构化 HTML/Markdown 输出、视觉语言模型处理,以及通过 Docker Compose 自托管部署,可配置 LLM 提供商。
一位开发者分享了在RTX 3060上使用本地Qwen VL模型将日语收据解析为JSON的经验,取代了Google Vision,结果显示关键字段提取准确,每张收据约需31秒。
本文介绍了ZooClaw-FashionSigLIP2,一个专注于时尚领域的视觉-语言模型,它通过全微调、知识蒸馏和权重插值实现了卓越的检索性能,超越了更大的骨干网络和LoRA。此外,本文还发布了一个新的高质量基准测试ZooClaw-Fashion,并分析了现有数据集中的结构性偏差。
本文介绍了潜在桥(Latent Bridge),一种可训练的连续通道,它将慢速推理VLM(Qwen3-VL-8B-Thinking)和快速反应VLM(MiniCPM-o 4.5)耦合起来,用于实时游戏智能体。在Atari游戏和MetaDrive上的实验表明,该通道在性能上与基于文本的桥接器相当或更优,并且单独使用时避免了破坏性干扰。
物理问题场景图(PQSG)是一种基于层次化问题的评估流程,利用视觉语言模型(VLM)对视频生成模型的物理合理性进行细粒度的违规检测。该工作引入了FinePhyEval数据集,并显示出比以往工作更高的与人类判断的相关性。
本文介绍了CF-World,一个用于评估文本到图像模型是否依赖因果推理或仅仅是模式匹配的反事实基准。实验表明,所有模型在反事实设置下表现急剧下降,表明它们的理解仅限于视觉-文本紧密耦合的模式,而非真正的因果推理。
ABACUS 是一个统一的视觉语言模型,可处理多个计数任务和忠实于计数的图像生成,无需针对特定基准进行训练,在七个基准测试中取得了最先进的结果。
Semantic Browsing 引入了一种方法,通过使用一个 Vision Language Model 和代理工作流,在文本到图像生成中实现基于语义决策的结构化、可解释的可控多样性。
Loft Orbital的YAM-9卫星在轨运行谷歌的Gemma 3视觉语言模型,用于实时图像分析,通过决定发送哪些数据到地球,减少了下行带宽和延迟。
研究人员受Gemma 4 12B启发,仅花费100美元训练了一个无需视觉编码器的视觉语言模型,在M3 Pro MacBook上实现了端到端延迟降低30%。
NAVI-Orbital展示了零样本视觉语言模型(Gemma 3)在低地球轨道卫星上的首次在轨部署,无需微调即可实现自主场景分类和地球观测数据的语义压缩。
FinAcumen是一个框架,它将先前轨迹中的推理经验累积到持久记忆库中,用于金融多模态推理,在四个基准测试上提升了性能,同时保持冻结的8B视觉语言模型不变。
使用Mac Studio上的MLX-VLM对开放权重MiniMax M3模型进行的测试表明,它能够从驾照照片和扫描文档中自动读取信息,并通过工具调用填写字段、复选框和签名,自主完成美国海关表格的填写。
一颗名为 Yam-9 的卫星在轨使用了 Google DeepMind 的 Gemma 3 视觉语言模型,基于自然语言查询自主识别感兴趣区域,标志着首次有报道在太空中使用 VLM,并预示着卫星运行向更加自主的方向转变。
LLaVA-OneVision-2 引入了编解码流令牌化技术以实现高效的视频理解,在时间与空间基准测试上显著超越 Qwen3-VL-8B。模型、数据和代码均已开源。
SciOrch 提出了一种基于 MCTS 训练的 8B 视觉语言模型,用于协调多个专家级大语言模型进行多模态科学推理,在降低 API 成本的同时实现了更优性能。
来自Meta和卡内基梅隆大学的这篇论文提出了一种多模态视觉-语言模型管道,用于检测社交媒体上的AI生成内容,实现了最先进的性能,并对用户参与度产生了积极的下游影响。
本文介绍了一种面向视觉语言模型的自我演进框架,使其在没有外部监督的情况下提升提问能力,不仅提高了问题质量,还增强了回答者的表现。
本文提出了Architect-Ant,一个可编辑的建筑平面图自动家具布局框架,以及一个包含270个带家具标注的平面图的精选数据集(AntPlan-270)。该方法使用微调的视觉语言模型和领域特定语言生成几何有效且功能合理的家具布局,并可光栅化为蓝图风格图像。