哇,图像识别能力相当不错
摘要
一位用户通过关于追踪冰洞的特定提示,展示了令人印象深刻的图像识别能力,突显了模型的视觉理解水平。
第一个和第二个图像的提示原文:​ 1. 洞在哪里?仅用虚线闭合曲线精确描绘冰洞的轮廓。排除瓶口。生成一张图片来展示,不要对图像进行不必要的修改。​ 2. 我说的是洞,不是冰
相似文章
用图像思考
OpenAI 发布了 o3 和 o4-mini 模型,这些模型能够在链式思维过程中对图像进行推理,通过裁剪和缩放等原生图像操作工具实现视觉理解,无需额外的专用模型。这些模型在包括 STEM 问题、图表阅读和视觉搜索任务在内的多模态基准上达到了最先进的性能。
@HuggingModels: 想构建一个能看图像并用自然语言描述的AI吗?这个新模型就能做到。它是一个视觉编码器-解码器…
介绍了一种新型视觉编码器-解码器模型,能够同时处理图像和文本,生成类人回应,适用于图像字幕和视觉问答等任务。
唉,我怀念那些AI图像一眼就能识别的日子
一则怀旧评论,怀念AI生成图像曾能轻易与真实图像区分开来的时代,并突出了视觉AI的日益成熟。
@XFreeze:Grok Imagine 的图像和视频生成能力确实令人难以置信,其逼真程度极高,以至于开始模糊AI生成与真实之间的界限……
一条推文强调了 Grok Imagine 的图像和视频生成能力,称赞其高度逼真,模糊了 AI 与现实之间的界限。
极其精准的新图像模型
一位用户在 AIArena 上发现了一个名为 'autobear' 的匿名图像生成模型,据称能生成高度准确的信息图,但其来源和身份未知。