vision-language-model

标签

Cards List
#vision-language-model

自我演进的视觉提问器

Hugging Face Daily Papers · 2026-06-11 缓存

本文介绍了一种面向视觉语言模型的自我演进框架,使其在没有外部监督的情况下提升提问能力,不仅提高了问题质量,还增强了回答者的表现。

0 人收藏 0 人点赞
#vision-language-model

Architect-Ant:可编辑的建筑平面图自动家具布局

arXiv cs.AI · 2026-06-10 缓存

本文提出了Architect-Ant,一个可编辑的建筑平面图自动家具布局框架,以及一个包含270个带家具标注的平面图的精选数据集(AntPlan-270)。该方法使用微调的视觉语言模型和领域特定语言生成几何有效且功能合理的家具布局,并可光栅化为蓝图风格图像。

0 人收藏 0 人点赞
#vision-language-model

世界模型自蒸馏:训练世界模型解决通用任务

Hugging Face Daily Papers · 2026-06-10 缓存

一个可扩展的框架结合了自蒸馏和强化学习,将任务解决能力从视觉语言模型迁移到视频扩散模型,无需标注的任务-视频数据。

0 人收藏 0 人点赞
#vision-language-model

OmniGameArena:面向VLM游戏代理的统一UE5基准与改进动态

Hugging Face Daily Papers · 2026-06-08 缓存

OmniGameArena 引入了一个统一的基准,用于在多样化的Unreal Engine 5游戏环境中评估VLM代理,该基准包含一个改进动态曲线,用于追踪技能在反思轮次中的演化过程。

0 人收藏 0 人点赞
#vision-language-model

VoLo: 开放词汇长程操作的物理编排器

Hugging Face Daily Papers · 2026-06-05 缓存

VoLoAgent 将视觉语言模型与机器人能力相结合,用于开放词汇长程操作任务,引入了一个物理编排器,该编排器使用可中断工具进行规划、监控和恢复,并提出了一个名为 RoboVoLo 的基准用于评估。

0 人收藏 0 人点赞
#vision-language-model

@_philschmid: 我们昨天发布了 Gemma 4 12B。这里有一份详细解析其完整架构的可视化指南。→ 编码器通常如何…

X AI KOLs Following · 2026-06-04 缓存

一份解析 Gemma 4 12B 完整架构的可视化指南,介绍了该模型如何在移除传统视觉和音频编码器的情况下,无需独立编码器模型即可处理文本、图像和音频。

0 人收藏 0 人点赞
#vision-language-model

位置、类型、原因与重要性:面向文本到图像反馈的结构化缺陷定位

Hugging Face Daily Papers · 2026-06-04 缓存

本文提出结构化缺陷定位(SDG)方法,将文本到图像缺陷建模为(位置、类型、原因、重要性)结构化元组,并利用视觉语言模型(VLM)进行检测,同时构建了包含3万张图像的SDG-30K数据集以及名为BoxFlow-GRPO的诊断到对齐框架。

0 人收藏 0 人点赞
#vision-language-model

Holo3.1 35B/9B/4B/0.8B (Qwen 3.5微调版)

Reddit r/LocalLLaMA · 2026-06-03

H Company发布Holo3.1,这是一个面向计算机使用代理的视觉语言模型系列(0.8B至35B),支持Web、桌面和移动端自动化,具备原生函数调用功能,并提供优化后的量化检查点,便于本地部署。

0 人收藏 0 人点赞
#vision-language-model

MAOAM:基于视觉-语言模型的统一物体与材质选择

Hugging Face Daily Papers · 2026-06-02 缓存

本文提出MAOAM,一个统一的视觉-语言模型框架,能够通过文本或点击交互实现精确的物体和材质选择,用于交互式图像编辑。它引入了一个可扩展的数据生成流程,并展示了在推理时结合文本和点击的涌现提升。

0 人收藏 0 人点赞
#vision-language-model

PaddleOCR-VL-1.6:通过欠优化区域精炼与渐进式后训练拓展文档解析前沿

Hugging Face Daily Papers · 2026-06-02 缓存

PaddleOCR-VL-1.6 通过识别并精炼欠优化区域,结合针对性的数据优化与渐进式后训练,提升了文档解析性能,在 OmniDocBench v1.6 上达到 96.33% 的最新最优水平。

0 人收藏 0 人点赞
#vision-language-model

@Prince_Canuma:今天我们发布了最大规模的 MLX-VLM 更新:v0.6.0 ……并且我们正在提升。这次更新旨在将你的 Apple 设备……

X AI KOLs Following · 2026-06-01 缓存

MLX-VLM v0.6.0 已发布,新增推测解码、兼容 Anthropic API 的智能体服务器、新模型(DeepSeek V4、ZAYA1-VL 等)、图像生成/编辑以及音频输入支持,使 Apple 设备上能运行本地 AI 智能体。

0 人收藏 0 人点赞
#vision-language-model

MMG2Skill:智能体能否从真实世界指南中提炼出自我进化的技能?

Hugging Face Daily Papers · 2026-06-01 缓存

MMG2Skill通过闭环学习将网络上的过程性指南转化为智能体可执行的技能,在GUI操控、游戏玩法和纸牌游戏任务中提升了性能,宏平均提升了+12.8到+25.3个百分点。

0 人收藏 0 人点赞
#vision-language-model

PhyDrawGen:物理驱动的自然语言示意图生成

arXiv cs.AI · 2026-06-01 缓存

PhyDrawGen 是一个神经符号管道,它结合基于大语言模型的场景理解、确定性约束求解器以及基于视觉语言模型的验证循环,从自然语言生成物理精确的示意图,在物理问题基准测试中优于现有模型。

0 人收藏 0 人点赞
#vision-language-model

3DCodeBench:通过代码对智能体过程化3D建模进行基准测试

Hugging Face Daily Papers · 2026-05-31 缓存

本文介绍了3DCodeBench——一个用于评估视觉语言模型通过代码进行过程化3D建模的基准测试,以及3DCodeArena——一个基于成对人类偏好的排名平台。

0 人收藏 0 人点赞
#vision-language-model

架构敏感的监督微调用于基于屏幕条件的动作预测:PiSAR基准

arXiv cs.AI · 2026-05-29 缓存

本文介绍了用于基于屏幕条件的动作预测的PiSAR基准,并将监督微调模型与前沿零样本基线进行了比较。关键发现表明,微调的Qwen3-VL-8B达到了0.783的语义相似度,显著优于Claude Opus 4.7和GPT-5.5(0.459和0.482),但同样的微调配方应用于更大的推理调优Gemma模型仅产生0.441,表明存在模型与配方不匹配的问题。

0 人收藏 0 人点赞
#vision-language-model

VFEAgent: 一种用于端到端自动化有限元分析的多模态智能体框架

arXiv cs.AI · 2026-05-29 缓存

本文提出了VFEAgent,一种通过将视觉语言模型与验证优先的代码合成框架相结合来自动化有限元分析的多智能体系统,实现了从图像和问题描述到端到端模拟。

0 人收藏 0 人点赞
#vision-language-model

Stable-Layers:使用VLM评分的强化学习微调图像层分解模型

Hugging Face Daily Papers · 2026-05-28

Stable-Layers是一个强化学习框架,它利用VLM反馈而非配对监督来微调预训练的图层分解模型,采用Flow-GRPO与LoRA以及两阶段奖励校准流程,在Crello数据集上提升图层质量。

0 人收藏 0 人点赞
#vision-language-model

小巧但可信:高效视觉语言推理用于时间序列异常检测

Hugging Face Daily Papers · 2026-05-28 缓存

本文提出 VisAnomReasoner,一个参数高效的视觉语言模型,在带自然语言解释的新基准 VisAnomBench 上微调,在时间序列异常检测中精度和 F1 提升超过 21 个百分点,并展现出强大的跨基准泛化能力。

0 人收藏 0 人点赞
#vision-language-model

MedExpMem:经验记忆适配于鉴别诊断

arXiv cs.LG · 2026-05-25 缓存

提出MedExpMem,一个经验记忆框架,使医学视觉语言模型能够从过往病例中积累和检索具有鉴别性的诊断经验,在放射学基准上将鉴别诊断准确率最多提升7.0%。

0 人收藏 0 人点赞
#vision-language-model

InstructSAM:根据任意指令分割任意实例

Hugging Face Daily Papers · 2026-05-25 缓存

InstructSAM 提出了一个统一的框架,用于多实例分割,采用指令驱动的查询,桥接视觉语言模型和 SAM3,在复杂基准上取得了强劲结果。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈