标签
TeleOCR 是一款轻量级的开源视觉语言模型,专注于文档解析,通过多节点共识投票等技术,在数字和相机拍摄的文档上均达到了行业领先水平。
TeleOCR 是一个轻量级的开源视觉-语言模型,专为文档解析设计,统一处理数字文档和相机拍摄文档,并在基准测试中达到了最先进的性能。
一位用户分享了在多种语言上测试Liquid AI新推出的LFM2.5-VL-3B视觉语言模型的惊人结果,指出其视觉能力很强,但指令跟随能力低于预期;Liquid AI宣布该模型能够读取屏幕、文档,并将物体定位到坐标。
LiquidAI announces LFM2.5-VL-3B, an efficient vision-language model for edge hardware with improved screen understanding, grounding, multi-image input, and function calling, trained with 4x more vision data and post-training via SFT and RL.
本文通过将事后稀疏自编码器拟合到冻结的Vision Wormhole激活上,研究了视觉-语言模型智能体之间潜空间通信的可压缩性。结果表明,传输字节数减少了128倍,同时准确率损失极小,揭示了密集通信信道具有高度冗余性。
微软研究院推出了CARE-X,一个统一的胸部X射线视觉-语言模型,它结合了灵活推理、校准预测和工具增强测量,用于临床有用的放射学解读。
本文介绍了VectraYX-Vision-1B,一个面向西班牙语/拉美网络安全影像的亚20亿参数视觉语言模型,但报告了一项负面的视觉定位结果,引发了关于NoPE层的架构问题,并发布了代码、基准测试和检查点。
DocAtlas 是一个研究系统,将长文档理解构建为可变状态交互过程,利用带有搜索、阅读、笔记和审查工具的外部文档框架。它在 MMLongBench-Doc 上使用 GPT-5.4 取得了最先进的结果,并通过端到端强化学习大幅改进了紧凑型 VLM 代理。
作者在10万个样本上训练了一个40M参数的连接器,使DeepSeek V4 Flash获得基础的视觉能力,同时冻结语言模型和MoonViT图像编码器,展示了将纯文本MoE转变为基础VLM的低成本方法。
VLX-Seek-1.5-10B 是 omlab 推出的开源 10B 视觉语言模型,专为无人机、机器人和监控等具身场景中的细粒度视觉定位而设计,采用区域引用定位而非坐标生成。
This paper introduces Stockmark-Nemotron-3-Nano-Omni-JapanDocReader, a Japanese document understanding model built by injecting structured document parsing capability into a reasoning-oriented multimodal model while preserving VQA ability. It studies parsing-centric SFT, mixed SFT, and DAPO-based parsing-centric RL to improve structured parsing performance.
本文介绍了 Capek 0.5,一个以执行能力分类法为核心的具身视觉-语言模型,通过强化学习进行专家训练,随后采用权重空间融合和路由策略空间蒸馏。它提出了一个新的状态验证基准,并在2B和35B-A3B规模上展示了在具身和通用能力上的强劲性能。
介绍了VectraYX-Vision-1B,这是一个面向西班牙语/拉丁美洲网络安全的亚20亿参数视觉语言模型,通过MLP将冻结的SigLIP编码器与西班牙语解码器耦合;然而,尽管流水线功能完全正常,它却报告了近乎为零的视觉基础能力,并提供了开源权重和修复计划。
EffectLearner 是一个面向真实世界视频物体移除的语义推理增强框架,它将基于 VLM 的物体-效果推理器与基于 DiT 的视频擦除器相结合,并引入了 EffectWorld 数据集以处理复杂的物体引发效果。
介绍了OncoTriad-QA,一个整合放射学、病理学、基因组学和临床数据的患者级基准,用于泛癌推理;同时介绍了OncoVLM,一个参考多模态模型,在微调后性能优于现有的医学大语言模型。
SkalskiP 重点介绍了 Qwen3.8-Max,这是一个用于目标检测的视觉语言模型,可以通过正负框提示生成检测结果,在单个或多个提示下实现 60-80% 的 mAP,并且在不同类型的图像上表现良好。
研究人员评估了九个前沿视觉-语言模型在两个心理理论任务(Keysar指导者任务和Frith-Happé动画三角形)中的表现,发现模型在不同任务间呈现碎片化、不一致的ToM特征,而非匹配单一的成人参照组。模型在指导者任务上倾向于像儿童一样犯以自我为中心的错误,并在三角形任务上像高功能自闭症成人一样低估意图归因。
PosterMELD 是一个基于模板条件的多智能体流水线,可将学术论文转换为可编辑、可打印就绪的海报,实现了 81.3% 的打印就绪率,且成本低廉,并已发布代码和资源。
介绍了 AD-MCQ 和 DEFT-RLVR,一种用于自动驾驶 VLM 可验证推理的方法,将未来轨迹暴露延迟到决策后验证,从而提高推理忠实度并减少幻觉。
Roomer是一个反思式修复框架,用于识别和修复3D室内布局中的局部违规,它使用视觉语言模型规划器和确定性求解器,并引入了新的基准Roomer-CC和Roomer-Eval。