标签
H公司已发布两款视觉语言模型,Holo4-27B-GGUF和Holo4-35B-A3B-GGUF,专为计算机使用自动化而设计。这些模型基于Qwen架构构建,配合hai-agents harness执行点击、输入和代码等任务。
这条推文讨论了在没有真实标签的情况下为多边形输出设定质量指标的困难,但提出了一种可靠的三方协议方法。它强调了对于非专用视觉-语言模型而言令人印象深刻的结果,尽管存在假阳性/假阴性,并且注意到使用网格提示的改进。
一个小型视觉语言模型,能够回答关于图像的输入问题并提供校准的概率,针对消费级硬件的快速推理进行了优化。
今天,我们为视觉语言模型 (VLM) LFM2.5-VL-3B 发布了一个实验性的 DSpark 草稿模型,它增加了一个推测解码路径,以实现更快的推理速度,同时内存成本最小。
本文介绍了一项开源研究,通过基准测试和原生批处理、MLX量化等技术优化本地视觉语言模型的延迟,在Apple硬件上实现显著加速的同时保持决策准确性。
LensVLM-9B是苹果公司开发的一个拥有90亿参数的视觉语言模型,它能扫描压缩的文本图像,并利用学习到的工具选择性地展开相关页面,同时提供了论文、代码和使用说明。
HARMONY是一个开源框架,利用分层代理推理和VLMs从单张室内图像重建组合式3D场景,在视觉质量上与GPT-6 Astra竞争,并在几何对齐上表现更优。
Yohei Nakajima 提出一种方法,通过使用logits从冻结的开放视觉语言模型中读取类型化的视觉判断,达到与托管模型相似的准确性,同时减少时间和GPU成本。
本文提出了一种利用感知调整查询标准化感知难度的面部情感识别个体级校准框架,并在行为研究中进行了验证。
本文介绍了PlaceReasoner-Beta,一个验证器引导的多智能体框架,将宏单元放置重新表述为VLSI物理设计中的推理问题,在时序和线长方面实现了显著改进。同时,本文还介绍了PlaceReasoner-Bench,这是一个开放基准测试,用于评估使用布线后PPA和DRC的方法。
X-Planner 引入了一个事件结构化的规划前端,用于具身AI,通过监督数据和具有离散与潜在接口的VLM骨干网络,改善长时域操作中的任务规划。
RULER为SVG生成引入了实例感知的评分标准奖励,利用视觉语言评判器优化强化学习,显著提升性能,优于之前的方法。
Jina-ocr-v1是一款专为高级文档智能设计的多模态视觉语言模型,能够从多语言图像中读取文本。
本文提出了 PANORAMA,一个用于全景定位描述的视觉-语言模型,该模型通过掩码提案选择利用像素级掩码为描述进行定位,并引入了 PanoCaps 基准进行评估。
ModaLens是一种配对图像交换审计方法,用于测量报告可用性如何降低医学视觉语言模型中的图像敏感性,通过在MIMIC-CXR数据集上使用MedGemma-27B进行演示。
本学术论文提出了一种基于AI的系统,该系统利用热成像视频估算火炬塔的燃烧效率,并集成到具有高正常运行时间和低维护成本的图形用户界面中。
一个从使用工具的智能体蒸馏而来的2B视觉语言模型,通过剪枝其多语言嵌入表以满足参数限制,在长第一人称视频问答任务中取得了第一名,仅使用1.1%的参数就达到了更大管道89%的准确率。
阿里巴巴Qwen在Hugging Face上发布了一款开源的4B参数视觉语言模型,专为自动驾驶设计,集成了3D检测、占用预测和BEV功能,同时保留了强大的视觉语言能力。
Show-Harness是一种方法,它使视觉语言模型能够通过离散的语义动作来控制机器人,实现零样本部署和跨不同机器人与GUI的高效微调。
DeepSeek-V4-Flash-Vision-Exp 是一个视觉-语言模型,能够处理图像并生成文本,拥有超过 31.3 万次下载,适用于图像描述和视觉问答等任务。