vision-language-model

标签

Cards List
#vision-language-model

Holo4

Reddit r/LocalLLaMA ↗ · 昨天

H公司已发布两款视觉语言模型,Holo4-27B-GGUF和Holo4-35B-A3B-GGUF,专为计算机使用自动化而设计。这些模型基于Qwen架构构建,配合hai-agents harness执行点击、输入和代码等任务。

0 人收藏 0 人点赞
#vision-language-model

@lillyguisnet: 这里的质量指标有点困难,因为我没有耐心制作真实标签,但一个三方的…

X AI KOLs Following ↗ · 2天前 缓存

这条推文讨论了在没有真实标签的情况下为多边形输出设定质量指标的困难,但提出了一种可靠的三方协议方法。它强调了对于非专用视觉-语言模型而言令人印象深刻的结果,尽管存在假阳性/假阴性,并且注意到使用网格提示的改进。

0 人收藏 0 人点赞
#vision-language-model

我训练了一个500M参数的VLM,能够回答关于图像的输入问题(选择/评分/是与否),并提供校准的概率。在M1 Pro上约400毫秒,无文本生成 [P]

Reddit r/MachineLearning ↗ · 2天前 缓存

一个小型视觉语言模型,能够回答关于图像的输入问题并提供校准的概率,针对消费级硬件的快速推理进行了优化。

0 人收藏 0 人点赞
#vision-language-model

使用 LFM2.5-VL-DSpark 加速视觉语言模型

Hugging Face Blog ↗ · 5天前 缓存

今天,我们为视觉语言模型 (VLM) LFM2.5-VL-3B 发布了一个实验性的 DSpark 草稿模型,它增加了一个推测解码路径,以实现更快的推理速度,同时内存成本最小。

0 人收藏 0 人点赞
#vision-language-model

@yoheinakajima: glance-vlm speedlab 现已开源!阅读:https://glance.yohei.me/speed/ 尝试:https://github.com/yoheinakajima/glan…

X AI KOLs Timeline ↗ · 6天前 缓存

本文介绍了一项开源研究,通过基准测试和原生批处理、MLX量化等技术优化本地视觉语言模型的延迟,在Apple硬件上实现显著加速的同时保持决策准确性。

0 人收藏 0 人点赞
#vision-language-model

apple/LensVLM-9B · Hugging Face

Reddit r/LocalLLaMA ↗ · 6天前 缓存

LensVLM-9B是苹果公司开发的一个拥有90亿参数的视觉语言模型,它能扫描压缩的文本图像,并利用学习到的工具选择性地展开相关页面,同时提供了论文、代码和使用说明。

0 人收藏 0 人点赞
#vision-language-model

HARMONY: 用于单目图像到场景合成的分层代理推理

Hugging Face Daily Papers ↗ · 2026-09-22 缓存

HARMONY是一个开源框架,利用分层代理推理和VLMs从单张室内图像重建组合式3D场景,在视觉质量上与GPT-6 Astra竞争,并在几何对齐上表现更优。

0 人收藏 0 人点赞
#vision-language-model

@yoheinakajima:在4B开放VLM上进行Jev式logit读取,实测:http://glance.yohei.me 与同一模型写入JSON相比:时间减少约1/3 …

X AI KOLs Timeline ↗ · 2026-09-21 缓存

Yohei Nakajima 提出一种方法,通过使用logits从冻结的开放视觉语言模型中读取类型化的视觉判断,达到与托管模型相似的准确性,同时减少时间和GPU成本。

0 人收藏 0 人点赞
#vision-language-model

利用感知调整查询实现情感识别的个体级校准

arXiv cs.LG ↗ · 2026-09-21 缓存

本文提出了一种利用感知调整查询标准化感知难度的面部情感识别个体级校准框架,并在行为研究中进行了验证。

0 人收藏 0 人点赞
#vision-language-model

PlaceReasoner-Beta: 推理驱动的宏单元放置与基准测试

arXiv cs.AI ↗ · 2026-09-21 缓存

本文介绍了PlaceReasoner-Beta,一个验证器引导的多智能体框架,将宏单元放置重新表述为VLSI物理设计中的推理问题,在时序和线长方面实现了显著改进。同时,本文还介绍了PlaceReasoner-Bench,这是一个开放基准测试,用于评估使用布线后PPA和DRC的方法。

0 人收藏 0 人点赞
#vision-language-model

X-Planner:面向具身智能的事件结构化任务规划

Hugging Face Daily Papers ↗ · 2026-09-21 缓存

X-Planner 引入了一个事件结构化的规划前端,用于具身AI,通过监督数据和具有离散与潜在接口的VLM骨干网络,改善长时域操作中的任务规划。

0 人收藏 0 人点赞
#vision-language-model

RULER:实例感知的评分标准奖励用于SVG生成

Hugging Face Daily Papers ↗ · 2026-09-21 缓存

RULER为SVG生成引入了实例感知的评分标准奖励,利用视觉语言评判器优化强化学习,显著提升性能,优于之前的方法。

0 人收藏 0 人点赞
#vision-language-model

@HuggingModels: OCR刚刚经历了一次重大升级。jina-ocr-v1是一款专为文档智能设计的多模态视觉语言模型。它 rea…

X AI KOLs Timeline ↗ · 2026-09-18 缓存

Jina-ocr-v1是一款专为高级文档智能设计的多模态视觉语言模型,能够从多语言图像中读取文本。

0 人收藏 0 人点赞
#vision-language-model

PANORAMA: 通过掩码提案选择实现的全景定位描述

Hugging Face Daily Papers ↗ · 2026-09-16 缓存

本文提出了 PANORAMA,一个用于全景定位描述的视觉-语言模型,该模型通过掩码提案选择利用像素级掩码为描述进行定位,并引入了 PanoCaps 基准进行评估。

0 人收藏 0 人点赞
#vision-language-model

ModaLens:在报告条件下的医学视觉语言模型中测量图像敏感性

Hugging Face Daily Papers ↗ · 2026-09-14 缓存

ModaLens是一种配对图像交换审计方法,用于测量报告可用性如何降低医学视觉语言模型中的图像敏感性,通过在MIMIC-CXR数据集上使用MedGemma-27B进行演示。

0 人收藏 0 人点赞
#vision-language-model

基于AI的火炬燃烧效率估算

arXiv cs.AI ↗ · 2026-09-12 缓存

本学术论文提出了一种基于AI的系统,该系统利用热成像视频估算火炬塔的燃烧效率,并集成到具有高正常运行时间和低维护成本的图形用户界面中。

0 人收藏 0 人点赞
#vision-language-model

Ambient @ EgoLongQA 2026:将长视频感知蒸馏到小于2B参数的模型中

Hugging Face Daily Papers ↗ · 2026-09-10 缓存

一个从使用工具的智能体蒸馏而来的2B视觉语言模型,通过剪枝其多语言嵌入表以满足参数限制,在长第一人称视频问答任务中取得了第一名,仅使用1.1%的参数就达到了更大管道89%的准确率。

0 人收藏 0 人点赞
#vision-language-model

@AdinaYakup: 这是新动态 👀 @Alibaba_Qwen 刚刚在 @huggingface 上发布了一个用于自动驾驶的开放 VLM 基础模型 - 4B / A…

X AI KOLs Following ↗ · 2026-09-09 缓存

阿里巴巴Qwen在Hugging Face上发布了一款开源的4B参数视觉语言模型,专为自动驾驶设计,集成了3D检测、占用预测和BEV功能,同时保留了强大的视觉语言能力。

0 人收藏 0 人点赞
#vision-language-model

Show-Harness:仅凭VLM代理即可控制机器人

Hugging Face Daily Papers ↗ · 2026-09-09 缓存

Show-Harness是一种方法,它使视觉语言模型能够通过离散的语义动作来控制机器人,实现零样本部署和跨不同机器人与GUI的高效微调。

0 人收藏 0 人点赞
#vision-language-model

@HuggingModels: 见过既能看图又能写文字的AI吗?DeepSeek-V4-Flash-Vision-Exp 就能做到。这是一个视觉-语言模…

X AI KOLs Timeline ↗ · 2026-09-08

DeepSeek-V4-Flash-Vision-Exp 是一个视觉-语言模型,能够处理图像并生成文本,拥有超过 31.3 万次下载,适用于图像描述和视觉问答等任务。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈