vision-language-model

标签

Cards List
#vision-language-model

Aloe-Vision:面向医疗的鲁棒视觉-语言模型

arXiv cs.CL · 2026-06-29 缓存

Aloe-Vision 引入了一系列开放的医学视觉-语言模型,这些模型在经质量过滤的医学与通用数据混合集上训练,同时提供了用于可靠评估的新基准 CareQA-Vision。这些模型展现出具有竞争力的性能,同时也揭示了在对抗性输入面前的脆弱性。

0 人收藏 0 人点赞
#vision-language-model

@GithubProjects:Chunkr 是一个开源文档智能服务,可将 PDF、PPT、Word 文档和图像转换为结构化…

X AI KOLs Timeline · 2026-06-27 缓存

Chunkr 是一个开源文档智能服务,将 PDF、PPT、Word 文档和图像转换为结构化块,用于 RAG 和 LLM 流水线。它具有 OCR 布局分析、结构化 HTML/Markdown 输出、视觉语言模型处理,以及通过 Docker Compose 自托管部署,可配置 LLM 提供商。

0 人收藏 0 人点赞
#vision-language-model

在RTX 3060上运行的Qwen3.6-35B-A3B能否取代Google Vision进行收据到JSON的提取?

Reddit r/LocalLLaMA · 2026-06-26

一位开发者分享了在RTX 3060上使用本地Qwen VL模型将日语收据解析为JSON的经验,取代了Google Vision,结果显示关键字段提取准确,每张收据约需31秒。

0 人收藏 0 人点赞
#vision-language-model

ZooClaw-FashionSigLIP2:基于蒸馏微调的鲁棒时尚检索

Hugging Face Daily Papers · 2026-06-26 缓存

本文介绍了ZooClaw-FashionSigLIP2,一个专注于时尚领域的视觉-语言模型,它通过全微调、知识蒸馏和权重插值实现了卓越的检索性能,超越了更大的骨干网络和LoRA。此外,本文还发布了一个新的高质量基准测试ZooClaw-Fashion,并分析了现有数据集中的结构性偏差。

0 人收藏 0 人点赞
#vision-language-model

潜在桥:用于实时游戏智能体的连续慢-快通道

arXiv cs.AI · 2026-06-24 缓存

本文介绍了潜在桥(Latent Bridge),一种可训练的连续通道,它将慢速推理VLM(Qwen3-VL-8B-Thinking)和快速反应VLM(MiniCPM-o 4.5)耦合起来,用于实时游戏智能体。在Atari游戏和MetaDrive上的实验表明,该通道在性能上与基于文本的桥接器相当或更优,并且单独使用时避免了破坏性干扰。

0 人收藏 0 人点赞
#vision-language-model

物理问题场景图:文本到视频生成中物理合理性的细粒度评估

Hugging Face Daily Papers · 2026-06-24 缓存

物理问题场景图(PQSG)是一种基于层次化问题的评估流程,利用视觉语言模型(VLM)对视频生成模型的物理合理性进行细粒度的违规检测。该工作引入了FinePhyEval数据集,并显示出比以往工作更高的与人类判断的相关性。

0 人收藏 0 人点赞
#vision-language-model

文本到图像模型是归纳主义火鸡吗?一个用于因果推理的反事实基准

Hugging Face Daily Papers · 2026-06-23 缓存

本文介绍了CF-World,一个用于评估文本到图像模型是否依赖因果推理或仅仅是模式匹配的反事实基准。实验表明,所有模型在反事实设置下表现急剧下降,表明它们的理解仅限于视觉-文本紧密耦合的模式,而非真正的因果推理。

0 人收藏 0 人点赞
#vision-language-model

ABACUS: 适配统一基础模型以桥接图像计数理解与生成

Hugging Face Daily Papers · 2026-06-22 缓存

ABACUS 是一个统一的视觉语言模型,可处理多个计数任务和忠实于计数的图像生成,无需针对特定基准进行训练,在七个基准测试中取得了最先进的结果。

0 人收藏 0 人点赞
#vision-language-model

Semantic Browsing: 图像生成中的可控多样性

Hugging Face Daily Papers · 2026-06-22 缓存

Semantic Browsing 引入了一种方法,通过使用一个 Vision Language Model 和代理工作流,在文本到图像生成中实现基于语义决策的结构化、可解释的可控多样性。

0 人收藏 0 人点赞
#vision-language-model

一颗卫星现在在轨道上运行谷歌的Gemma 3视觉语言模型,进行星载推理,而不是先下行传输所有数据

Reddit r/singularity · 2026-06-19

Loft Orbital的YAM-9卫星在轨运行谷歌的Gemma 3视觉语言模型,用于实时图像分析,通过决定发送哪些数据到地球,减少了下行带宽和延迟。

0 人收藏 0 人点赞
#vision-language-model

@andimarafioti:没有视觉编码器,VLM也能‘看见’吗?我们受Gemma 4 12B启发,花100美元训练了一个。在M3 Pro MacBook上的延迟:…

X AI KOLs Timeline · 2026-06-18 缓存

研究人员受Gemma 4 12B启发,仅花费100美元训练了一个无需视觉编码器的视觉语言模型,在M3 Pro MacBook上实现了端到端延迟降低30%。

0 人收藏 0 人点赞
#vision-language-model

NAVI-Orbital: 面向自主地球观测的零样本视觉语言模型的首次在轨演示

arXiv cs.AI · 2026-06-18 缓存

NAVI-Orbital展示了零样本视觉语言模型(Gemma 3)在低地球轨道卫星上的首次在轨部署,无需微调即可实现自主场景分类和地球观测数据的语义压缩。

0 人收藏 0 人点赞
#vision-language-model

FinAcumen:基于自演化经验记忆框架的金融多模态推理

arXiv cs.AI · 2026-06-17 缓存

FinAcumen是一个框架,它将先前轨迹中的推理经验累积到持久记忆库中,用于金融多模态推理,在四个基准测试上提升了性能,同时保持冻结的8B视觉语言模型不变。

0 人收藏 0 人点赞
#vision-language-model

@atomic_chat_hq: 开放权重 MiniMax M3 通过驾照照片填写美国海关表格 本次测试中,我们部署了MiniMax M3…

X AI KOLs Timeline · 2026-06-15 缓存

使用Mac Studio上的MLX-VLM对开放权重MiniMax M3模型进行的测试表明,它能够从驾照照片和扫描文档中自动读取信息,并通过工具调用填写字段、复选框和签名,自主完成美国海关表格的填写。

0 人收藏 0 人点赞
#vision-language-model

一颗卫星刚刚学会了自主寻找目标——这意味着什么

TechCrunch AI · 2026-06-15 缓存

一颗名为 Yam-9 的卫星在轨使用了 Google DeepMind 的 Gemma 3 视觉语言模型,基于自然语言查询自主识别感兴趣区域,标志着首次有报道在太空中使用 VLM,并预示着卫星运行向更加自主的方向转变。

0 人收藏 0 人点赞
#vision-language-model

@jiqizhixin: 如果你的AI能像流媒体编解码器一样“看”视频——只把令牌花在最关键的时刻?介绍……

X AI KOLs Timeline · 2026-06-15 缓存

LLaVA-OneVision-2 引入了编解码流令牌化技术以实现高效的视频理解,在时间与空间基准测试上显著超越 Qwen3-VL-8B。模型、数据和代码均已开源。

0 人收藏 0 人点赞
#vision-language-model

SciOrch:学习编排专家级大语言模型以解决前沿多模态科学推理任务

Hugging Face Daily Papers · 2026-06-14 缓存

SciOrch 提出了一种基于 MCTS 训练的 8B 视觉语言模型,用于协调多个专家级大语言模型进行多模态科学推理,在降低 API 成本的同时实现了更优性能。

0 人收藏 0 人点赞
#vision-language-model

使用多模态语言模型检测社交媒体上的AI生成内容

arXiv cs.CL · 2026-06-11 缓存

来自Meta和卡内基梅隆大学的这篇论文提出了一种多模态视觉-语言模型管道,用于检测社交媒体上的AI生成内容,实现了最先进的性能,并对用户参与度产生了积极的下游影响。

0 人收藏 0 人点赞
#vision-language-model

自我演进的视觉提问器

Hugging Face Daily Papers · 2026-06-11 缓存

本文介绍了一种面向视觉语言模型的自我演进框架,使其在没有外部监督的情况下提升提问能力,不仅提高了问题质量,还增强了回答者的表现。

0 人收藏 0 人点赞
#vision-language-model

Architect-Ant:可编辑的建筑平面图自动家具布局

arXiv cs.AI · 2026-06-10 缓存

本文提出了Architect-Ant,一个可编辑的建筑平面图自动家具布局框架,以及一个包含270个带家具标注的平面图的精选数据集(AntPlan-270)。该方法使用微调的视觉语言模型和领域特定语言生成几何有效且功能合理的家具布局,并可光栅化为蓝图风格图像。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈