vision-model

标签

Cards List
#vision-model

GLM 5.3 Flash 在图像分析方面表现惊人!

Reddit r/LocalLLaMA · 2026-08-28

一位用户测试了 GLM 5.3 Flash 的图像分析功能,并赞扬其详细且准确的性能,与其他视觉模型相比表现出色。

0 人收藏 0 人点赞
#vision-model

tencent/WeMM-Embedding 9B/4B/2B

Reddit r/LocalLLaMA · 2026-08-25

腾讯推出 WeMM-Embedding,这是一系列基于 Qwen3.5 构建的通用多模态嵌入模型,提供 9B、4B 和 2B 尺寸,支持文本、图像、视频和视觉文档的嵌入生成。

0 人收藏 0 人点赞
#vision-model

@HuggingModels: 曾想过拥有一个真正理解电子商务的视觉模型吗?来认识一下 Trendyol Vision Master,一个为目录审核和产品理解而构建的 GGUF 多模态强大工具 …

X AI KOLs Timeline · 2026-08-23 缓存

Trendyol Vision Master 是一个 GGUF 多模态视觉模型,专为电子商务应用设计,如目录审核和产品理解,充当在线商店的 AI 助手。

0 人收藏 0 人点赞
#vision-model

DeepSeek-v4-flash-vision-exp 体验版

Hacker News Top · 2026-08-21 缓存

本文档提供了DeepSeek视觉模型'deepseek-v4-flash-vision-exp'的使用说明,介绍了如何通过API使用base64编码、URL或文件引用等方式,结合文本提示来处理图像。

0 人收藏 0 人点赞
#vision-model

Qwen 3.8 27B 表现优异,但默认启用过度推理模式

Simon Willison's Blog · 2026-08-16 缓存

Qwen 3.8 27B 是阿里巴巴通义千问实验室推出的一款强大的开源270亿参数多模态大语言模型。它在基准测试中表现突出,但被批评默认启用过度推理模式,这在消费级硬件上拖慢了运行速度。

0 人收藏 0 人点赞
#vision-model

Mistral OCR 4.1

Hacker News Top · 2026-08-13 缓存

Mistral AI 发布 OCR 4.1,这是一项更新的 OCR 服务,支持原生段落级边界框提取、结构块标签以及块级置信度评分,现已公开预览。

0 人收藏 0 人点赞
#vision-model

我让DeepSeek-V4-Flash与Muse-Glimmer协作,为PI代理赋予视觉能力,结果它生成了这个

Reddit r/LocalLLaMA · 2026-08-13

用户展示了一个AI代理工作流:DeepSeek-V4-Flash与Muse-Glimmer视觉模型协作,利用截图作为视觉反馈,迭代构建了一个逼真的汽车行驶HTML画布动画。在后续运行中,DeepSeek抛弃了视觉模型,转而使用PIL检查图像,在不到10分钟内生成了一个惊艳的“黄金时刻”场景。

0 人收藏 0 人点赞
#vision-model

LFM2.5-VL-3B 在 iPhone 17 上本地运行,能识别《我的世界》中的 Steve

Reddit r/LocalLLaMA · 2026-08-12

Liquid AI 发布了 LFM2.5-VL-3B,这是一个 3.1B 参数的视觉模型,可在 iPhone 17 上本地运行,能识别《我的世界》中的 Steve 玩偶等物体,空间定位能力显著提升(ScreenSpot-v2 桌面端从 6 分提升到 78.7 分)。

0 人收藏 0 人点赞
#vision-model

推出 Muse Glimmer

Simon Willison's Blog · 2026-08-10 缓存

Meta 推出 Muse Glimmer,一款基于 Apache 2.0 协议的全新 30B 开放权重模型,针对智能体任务完成、可靠工具使用和多步推理进行了优化。Simon Willison 使用 LM Studio 和 llm-coding-agent 在本地对其进行了测试。

0 人收藏 0 人点赞
#vision-model

仅用64个视觉token,460M VLM在iPhone上首token延迟降至0.3秒

Reddit r/LocalLLaMA · 2026-08-05

VisionPsy-Nano-460M-Flash 是一款全新的460M视觉语言模型,每张图像仅使用64个视觉token,在iPhone上首token延迟降至0.3秒,同时保留了完整模型约99%的基准分数。这种优化牺牲了部分OCR和精细细节质量。

0 人收藏 0 人点赞
#vision-model

@svpino:我一直在测试Kimi K3,天哪,这是世界上见过的最好的开放权重模型。它是一个2.8T参数的…

X AI KOLs Timeline · 2026-08-05 缓存

Santiago Valdarrama 报道称,Kimi K3 是他测试过的最好的开放权重模型,一个2.8T参数的视觉模型,支持工具调用和推理,并拥有1M上下文窗口。

0 人收藏 0 人点赞
#vision-model

GPT-5.5 在 ActiveVision 上得分 10.6%,人类达到 96.1% [R]

Reddit r/MachineLearning · 2026-07-23

一篇新的 arXiv 论文引入了 ActiveVision 基准测试,旨在测试重复视觉感知能力,发现前沿视觉模型如 GPT-5.5 和 Claude Fable 5 分别仅得分 10.6% 和 3.5%,而人类达到了 96.1%。

0 人收藏 0 人点赞
#vision-model

@corbin_braun: https://x.com/corbin_braun/status/2077244527988113420

X AI KOLs Following · 2026-07-15 缓存

Corbin Braun 构建了一个进化式 A/B 缩略图测试工具,该工具每次只突变一个维度,使用 ABBA 模式轮换缩略图以避免偏差,并在多轮迭代中学习获胜突变。

0 人收藏 0 人点赞
#vision-model

@NVIDIAAI: 我们为一个编码智能体设定了目标与时间预算:构建训练环境并教会视觉模型数彩色星星…

X AI KOLs Timeline · 2026-07-14 缓存

NVIDIA 展示了一个编码智能体,它自主构建了训练环境并教会 Qwen3-VL-2B 数彩色星星,使用 NeMo RL 和 NeMo Gym 框架将准确率从 25% 提升至 96.9%。

0 人收藏 0 人点赞
#vision-model

@rohanpaul_ai:一个仅1B参数的视觉模型在深度估计上击败了7B模型,且是冻结状态、单线性层、零微调。@robbyant_brain…

X AI KOLs Timeline · 2026-07-08 缓存

Robbyant发布了LingBot-Vision,一个基于边界训练的1B参数视觉模型,在深度估计上优于DINOv3-7B,且权重开放。

0 人收藏 0 人点赞
#vision-model

我构建了一个微型代理,为GLM 5.2(或任何文本LLM)赋予视觉能力 – MIT

Reddit r/LocalLLaMA · 2026-07-07 缓存

VisionBridge是一个开源代理,通过让推理模型查询独立的视觉模型进行图像检查、OCR等操作,为纯文本LLM赋予视觉能力。

0 人收藏 0 人点赞
#vision-model

@stevibe: 三种销毁一张纸的方法。Qwen 3.5 35B A3B 对比 Ornith 1.0 35B,并排画布测试。(为什么是3.5而不是3.6?或者……)

X AI KOLs Timeline · 2026-06-27 缓存

一项并排画布测试,对比了Qwen 3.5 35B A3B和Ornith 1.0 35B在三种纸张销毁任务(切割、碎纸、揉团)上的表现,Ornith取得决定性胜利,展示了在Qwen 3.5和Gemma 4上进行后训练的价值。

0 人收藏 0 人点赞
#vision-model

@RoundtableSpace: 网页抓取已死。PixelRAG 完全跳过 HTML 解析。它截取页面截图,视觉模型直接读取答案…

X AI KOLs Timeline · 2026-06-21 缓存

PixelRAG 是一款开源工具,通过使用截图和视觉模型从网页中提取数据,取代了传统的网页抓取。它包含一个 Claude Code 插件。

0 人收藏 0 人点赞
#vision-model

可在RTX 6000 Pro上运行的最佳图像视觉模型

Reddit r/LocalLLaMA · 2026-06-21

讨论可在RTX 6000 Pro GPU上运行的最佳图像视觉模型,可能侧重于本地推理性能和兼容性。

0 人收藏 0 人点赞
#vision-model

@DailyDoseOfDS_:在您自己的语言上微调DeepSeek-OCR!(100%本地)大多数视觉模型将文档视为巨大的序列…

X AI KOLs Timeline · 2026-06-08 缓存

DeepSeek-OCR是一个3B参数的视觉模型,使用上下文光学压缩进行高效的文档处理。使用Unsloth在波斯语文本上进行微调,字符错误率降低了88.26%,全部开源且可在单GPU上运行。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈