哇,图像识别能力相当不错
摘要
一位用户通过关于追踪冰洞的特定提示,展示了令人印象深刻的图像识别能力,突显了模型的视觉理解水平。
第一个和第二个图像的提示原文:​ 1. 洞在哪里?仅用虚线闭合曲线精确描绘冰洞的轮廓。排除瓶口。生成一张图片来展示,不要对图像进行不必要的修改。​ 2. 我说的是洞,不是冰
相似文章
@rohanpaul_ai: 太美了,从单次识别到持久视觉记忆
一条推文,称赞 CollovLabs 在 AI 领域从单次识别到持久视觉记忆的进步。
用图像思考
OpenAI 发布了 o3 和 o4-mini 模型,这些模型能够在链式思维过程中对图像进行推理,通过裁剪和缩放等原生图像操作工具实现视觉理解,无需额外的专用模型。这些模型在包括 STEM 问题、图表阅读和视觉搜索任务在内的多模态基准上达到了最先进的性能。
@HuggingModels: 想构建一个能看图像并用自然语言描述的AI吗?这个新模型就能做到。它是一个视觉编码器-解码器…
介绍了一种新型视觉编码器-解码器模型,能够同时处理图像和文本,生成类人回应,适用于图像字幕和视觉问答等任务。
唉,我怀念那些AI图像一眼就能识别的日子
一则怀旧评论,怀念AI生成图像曾能轻易与真实图像区分开来的时代,并突出了视觉AI的日益成熟。
@HuggingModels: 见过既能看图又能写文字的AI吗?DeepSeek-V4-Flash-Vision-Exp 就能做到。这是一个视觉-语言模…
DeepSeek-V4-Flash-Vision-Exp 是一个视觉-语言模型,能够处理图像并生成文本,拥有超过 31.3 万次下载,适用于图像描述和视觉问答等任务。