标签
本文介绍了Libra,这是一种针对多模态大型语言模型的解耦视觉-语言架构,能够实现图像到文本的理解和文本到图像的生成,在基准测试中表现出色。
本文介绍了MoE-ViE,一种混合专家视觉编码器,能够高效扩展以支持图像和视频理解,并以更低的推理延迟超越更大的密集模型。
ClinFusion 是阿里巴巴达摩院推出的新开源医学多模态 LLM,提供 8B 和 32B 两种参数规模(Apache 2.0),具备统一的 2D + 3D 图像理解能力,并在医学基准测试上取得了最先进的结果。
一条推文声称 Qwen3.8-Max 是最佳目标检测 VLM,在卫星、红外、文档和手绘图像方面表现出色,并分享了示例。
Inkling is a large open-weights multimodal model (975B total, 41B active parameters) using a sparse MoE architecture, accepting text, image, and audio inputs and generating text outputs, intended for agentic systems, coding assistants, and chatbots.
Snippai 是一款完全开源免费的截图识别 AI 工具,支持公式转 LaTeX、文字提取、表格转 Markdown、图像理解、截图解题、代码解释、色彩分析和截图翻译等功能。
用户通过GPT-Live实时展示两套穿搭,AI针对见家长场景给出具体服装建议,展示了多轮图像理解与场景化建议能力。