image-understanding

标签

Cards List
#image-understanding

用于多模态理解和生成的解耦视觉-语言系统

arXiv cs.CL · 23小时前 缓存

本文介绍了Libra,这是一种针对多模态大型语言模型的解耦视觉-语言架构,能够实现图像到文本的理解和文本到图像的生成,在基准测试中表现出色。

0 人收藏 0 人点赞
#image-understanding

MoE-ViE:高效图像与视频理解的混合专家视觉编码器

Hugging Face Daily Papers · 2026-08-18 缓存

本文介绍了MoE-ViE,一种混合专家视觉编码器,能够高效扩展以支持图像和视频理解,并以更低的推理延迟超越更大的密集模型。

0 人收藏 0 人点赞
#image-understanding

@AdinaYakup: ClinFusion 来自阿里巴巴达摩院的新开源医学多模态 LLM - 8B/32B(Apache2.0)- 统一 2D + 3D 图像理解…

X AI KOLs Following · 2026-08-05 缓存

ClinFusion 是阿里巴巴达摩院推出的新开源医学多模态 LLM,提供 8B 和 32B 两种参数规模(Apache 2.0),具备统一的 2D + 3D 图像理解能力,并在医学基准测试上取得了最先进的结果。

0 人收藏 0 人点赞
#image-understanding

@skalskip92: Qwen3.8-Max 是最佳目标检测 VLM - 卫星图像 - 红外图像 - 文档 - 技术图纸 - 手…

X AI KOLs Timeline · 2026-08-03 缓存

一条推文声称 Qwen3.8-Max 是最佳目标检测 VLM,在卫星、红外、文档和手绘图像方面表现出色,并分享了示例。

0 人收藏 0 人点赞
#image-understanding

thinkingmachines/Inkling

Hugging Face Models Trending · 2026-07-14 缓存

Inkling is a large open-weights multimodal model (975B total, 41B active parameters) using a sparse MoE architecture, accepting text, image, and audio inputs and generating text outputs, intended for agentic systems, coding assistants, and chatbots.

0 人收藏 0 人点赞
#image-understanding

@Jolyne_AI: 跟大家安利一款好用的截图识别 AI 工具:Snippai。完全开源免费,识别稳、准、快。 不止能把图片里的文字和公式抠出来,还能读懂图像内容、把表格转成可用格式,甚至对截图里的题目直接给思路和答案。 GitHub:http://githu…

X AI KOLs Timeline · 2026-07-03 缓存

Snippai 是一款完全开源免费的截图识别 AI 工具,支持公式转 LaTeX、文字提取、表格转 Markdown、图像理解、截图解题、代码解释、色彩分析和截图翻译等功能。

0 人收藏 0 人点赞
#image-understanding

Image interaction with GPT-Live

YouTube AI Channels · 2026-07-09 缓存

用户通过GPT-Live实时展示两套穿搭,AI针对见家长场景给出具体服装建议,展示了多轮图像理解与场景化建议能力。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈