vision-language-model

标签

Cards List
#vision-language-model

TANGO:基于全身视觉-语言-动作模型的人形机器人在杂乱环境中的导航

Hugging Face Daily Papers ↗ · 2026-09-08 缓存

TANGO 是一个视觉-语言-动作框架,用于人形机器人在杂乱环境中导航,使用模拟训练数据,展示了最先进的性能和零样本真实世界部署。

0 人收藏 0 人点赞
#vision-language-model

CARDEA:基于空间证据的可审计推理用于端到端冠状动脉造影解释

Hugging Face Daily Papers ↗ · 2026-09-07 缓存

CARDEA是一种AI模型,旨在为冠状动脉造影解释提供可审计的推理,使用Chain-of-Box来指示图像区域,增强临床实践中的信任。

0 人收藏 0 人点赞
#vision-language-model

@maximelabonne: 一款理解和探索 VLM 评估的便捷应用

X AI KOLs Timeline ↗ · 2026-09-05 缓存

一款共享应用,用于探索和了解视觉语言模型评估,参考了分析热门视觉基准测试的讨论串。

0 人收藏 0 人点赞
#vision-language-model

Jina-OCR-v1:采用推测解码与密集可验证奖励的高效文档解析

arXiv cs.CL ↗ · 2026-09-04 缓存

Jina-OCR-v1 是一款高效的端到端文档解析模型,通过结合推测解码与密集可验证奖励技术,可在低预算 GPU 上实现高精度与高处理速度,在 OmniDocBench v1.6 上得分 91.14,olmOCR-Bench 上得分 83.4。

0 人收藏 0 人点赞
#vision-language-model

可编辑视觉设计

Hugging Face Daily Papers ↗ · 2026-09-03 缓存

由视觉语言模型引导的编码代理通过合成视觉资源和优化HTML/CSS布局,生成可编辑的分层设计,实现具有精确控制的后编辑。

0 人收藏 0 人点赞
#vision-language-model

WorldReward: 针对相机条件化世界模型的奖励建模

Hugging Face Daily Papers ↗ · 2026-09-03 缓存

WorldReward 介绍了一种针对相机条件化世界模型的视觉语言奖励模型,通过分块分解和偏好聚合统一了动作一致性和视觉质量评估,在基准测试中优于现有方法如GPT-5.5。

0 人收藏 0 人点赞
#vision-language-model

@adithya_s_k: 你真的可以用RL训练一个4B VLM来征服GeoGuesser > 开源代码、RL环境、数据集、训练设置、评估,以及…

X AI KOLs Timeline ↗ · 2026-09-02 缓存

公告宣布将发布开源资源,包括代码、RL环境和数据集,用于在4B VLM上应用RL以在GeoGuesser中表现出色,实现端到端复现。

0 人收藏 0 人点赞
#vision-language-model

SCAFFOLD:用于计算机科学研究图表的包含图表问答和思维链推理轨迹的大规模结构化数据集

arXiv cs.AI ↗ · 2026-09-02 缓存

SCAFFOLD 是一个大规模的计算机科学研究图表数据集,配有标题、上下文、问答和思维链轨迹,旨在提高视觉语言模型对计算机科学论文中图表的理解。

0 人收藏 0 人点赞
#vision-language-model

参数化多模态用户记忆:存储文字描述无法传达的信息

arXiv cs.CL ↗ · 2026-09-01 缓存

本文介绍了一种参数化多模态用户记忆系统,通过整合语音和外貌等感知数据,利用视觉语言模型和专用编码器,提升AI智能体回忆用户的能力,从而超越基于文本的方法。

0 人收藏 0 人点赞
#vision-language-model

一瞥足矣:使用SimLoss的单次细粒度图像描述

Hugging Face Daily Papers ↗ · 2026-09-01 缓存

SimLoss利用嵌入空间对比监督,实现单次细粒度图像描述,在降低延迟的同时达到多阶段质量,其中SimLoss FFT等变体实现了高精度。

0 人收藏 0 人点赞
#vision-language-model

FoldingAgent:从演示视频中推断参数化折纸程序

Hugging Face Daily Papers ↗ · 2026-08-31 缓存

FoldingAgent是一个智能框架,它使用视觉语言模型和专用工具,通过顺序推理和物理验证,从演示视频中推断参数化折纸折叠程序。

0 人收藏 0 人点赞
#vision-language-model

介绍Parse:大规模企业文档智能(5分钟阅读)

TLDR AI ↗ · 2026-08-28 缓存

Cohere推出了Parse,这是一种经济高效的视觉语言模型,用于处理大量企业文档并将其转化为结构化数据,为RAG和文档索引等用例提供高性能和可扩展性。

0 人收藏 0 人点赞
#vision-language-model

编织视觉叙事:超越原子级视觉匹配的智能体图像包组合

Hugging Face Daily Papers ↗ · 2026-08-27 缓存

本文介绍了图像包组合(IBC),将图像检索从原子级匹配转向连贯图像包的动态组合,以解决传统方法的局限性。它提出了基准数据集 IBCBench 和智能体框架 BundleWeaver,该框架利用大型语言模型(LLMs)和视觉语言模型(VLMs)进行关系组合。

0 人收藏 0 人点赞
#vision-language-model

1/100 → 44/100:在50K浏览器截图上微调450M VLM

Reddit r/LocalLLaMA ↗ · 2026-08-23

本文描述了使用50,000张浏览器截图微调450M VLM的过程,展示了从初始阶段到当前阶段的进展。

0 人收藏 0 人点赞
#vision-language-model

@HuggingModels: 你是否曾想要一个能够‘看到’医学图像并回答相关问题的人工智能?这个模型,llava-medical-8B-clip-vit-…

X AI KOLs Timeline ↗ · 2026-08-23 缓存

本文介绍了 llava-medical-8B-clip-vit-stage2,这是一个专为医疗保健领域微调的专用视觉语言模型,使人工智能能够解读 X 光和 MRI 等医学图像并回答相关问题。

0 人收藏 0 人点赞
#vision-language-model

QwenMix-3.7:注意到很多帖子说 Qwen3.8 和 3.6 结构相同,于是就让 Qwen3.8 将它们合并。

Reddit r/LocalLLaMA ↗ · 2026-08-20 缓存

QwenMix-3.7 是 Qwen3.6-27B 和 Qwen3.8-27B AI 模型的权重插值合并,在 t=0.5 时通过每行范数保持技术创建。

0 人收藏 0 人点赞
#vision-language-model

SemComp-Bench:视频生成中的语义任务完成基准测试

Hugging Face Daily Papers ↗ · 2026-08-18 缓存

SemComp-Bench 引入了一个用于评估视频生成中语义任务完成的基准,使用精选数据集和基于视觉语言模型的评估协议来评估结果达成度和生成可靠性。

0 人收藏 0 人点赞
#vision-language-model

ConceptFormer:学习自适应潜在概念以实现视觉文档检索中的查询-文档对齐

Hugging Face Daily Papers ↗ · 2026-08-16 缓存

ConceptFormer学习用于视觉文档检索的连续潜在概念表示,无需文本中间体即可连接视觉证据和语义相关性,相对于基线实现了显著改进。

0 人收藏 0 人点赞
#vision-language-model

MOSS-VL 技术报告

Hugging Face Daily Papers ↗ · 2026-08-15 缓存

MOSS-VL 是一个专为实时交互设计的开放视觉语言模型家族,使用门控交叉注意力机制在生成过程中处理视觉信息,并在开源模型的流式基准测试中取得顶尖性能。

0 人收藏 0 人点赞
#vision-language-model

LiquidAI LFM2.5-VL-3B:一款3.1B本地视觉语言模型超越Gemma-4 E4B——屏幕理解从2.5提升至82.2

Reddit r/artificial ↗ · 2026-08-14

LiquidAI发布了LFM2.5-VL-3B,这是一款3.1B本地视觉语言模型,性能超越Gemma-4 E4B,并在屏幕理解上展现了显著提升,使得设备端AI更加实用。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈