标签
TANGO 是一个视觉-语言-动作框架,用于人形机器人在杂乱环境中导航,使用模拟训练数据,展示了最先进的性能和零样本真实世界部署。
CARDEA是一种AI模型,旨在为冠状动脉造影解释提供可审计的推理,使用Chain-of-Box来指示图像区域,增强临床实践中的信任。
一款共享应用,用于探索和了解视觉语言模型评估,参考了分析热门视觉基准测试的讨论串。
Jina-OCR-v1 是一款高效的端到端文档解析模型,通过结合推测解码与密集可验证奖励技术,可在低预算 GPU 上实现高精度与高处理速度,在 OmniDocBench v1.6 上得分 91.14,olmOCR-Bench 上得分 83.4。
由视觉语言模型引导的编码代理通过合成视觉资源和优化HTML/CSS布局,生成可编辑的分层设计,实现具有精确控制的后编辑。
WorldReward 介绍了一种针对相机条件化世界模型的视觉语言奖励模型,通过分块分解和偏好聚合统一了动作一致性和视觉质量评估,在基准测试中优于现有方法如GPT-5.5。
公告宣布将发布开源资源,包括代码、RL环境和数据集,用于在4B VLM上应用RL以在GeoGuesser中表现出色,实现端到端复现。
SCAFFOLD 是一个大规模的计算机科学研究图表数据集,配有标题、上下文、问答和思维链轨迹,旨在提高视觉语言模型对计算机科学论文中图表的理解。
本文介绍了一种参数化多模态用户记忆系统,通过整合语音和外貌等感知数据,利用视觉语言模型和专用编码器,提升AI智能体回忆用户的能力,从而超越基于文本的方法。
SimLoss利用嵌入空间对比监督,实现单次细粒度图像描述,在降低延迟的同时达到多阶段质量,其中SimLoss FFT等变体实现了高精度。
FoldingAgent是一个智能框架,它使用视觉语言模型和专用工具,通过顺序推理和物理验证,从演示视频中推断参数化折纸折叠程序。
Cohere推出了Parse,这是一种经济高效的视觉语言模型,用于处理大量企业文档并将其转化为结构化数据,为RAG和文档索引等用例提供高性能和可扩展性。
本文介绍了图像包组合(IBC),将图像检索从原子级匹配转向连贯图像包的动态组合,以解决传统方法的局限性。它提出了基准数据集 IBCBench 和智能体框架 BundleWeaver,该框架利用大型语言模型(LLMs)和视觉语言模型(VLMs)进行关系组合。
本文描述了使用50,000张浏览器截图微调450M VLM的过程,展示了从初始阶段到当前阶段的进展。
本文介绍了 llava-medical-8B-clip-vit-stage2,这是一个专为医疗保健领域微调的专用视觉语言模型,使人工智能能够解读 X 光和 MRI 等医学图像并回答相关问题。
QwenMix-3.7 是 Qwen3.6-27B 和 Qwen3.8-27B AI 模型的权重插值合并,在 t=0.5 时通过每行范数保持技术创建。
SemComp-Bench 引入了一个用于评估视频生成中语义任务完成的基准,使用精选数据集和基于视觉语言模型的评估协议来评估结果达成度和生成可靠性。
ConceptFormer学习用于视觉文档检索的连续潜在概念表示,无需文本中间体即可连接视觉证据和语义相关性,相对于基线实现了显著改进。
MOSS-VL 是一个专为实时交互设计的开放视觉语言模型家族,使用门控交叉注意力机制在生成过程中处理视觉信息,并在开源模型的流式基准测试中取得顶尖性能。
LiquidAI发布了LFM2.5-VL-3B,这是一款3.1B本地视觉语言模型,性能超越Gemma-4 E4B,并在屏幕理解上展现了显著提升,使得设备端AI更加实用。