标签
本文介绍了ICDAR 2026原子层沉积/刻蚀(ALD/E)科学图表信息提取竞赛,提出了包含四个互补任务的Sci-ImageMiner基准数据集。结果表明,最先进的多模态模型在分类和摘要任务上表现良好,但在数据提取和科学推理方面存在困难,尤其是在视觉问答任务中。
AMD AI DevMaster黑客马拉松于2026年7月10日至8月6日举行,设有三个赛道(多模态AI、智能体AI、物理AI)和30,000美元奖金池,PyTorch作为ROCm支持的AMD GPU上的官方框架。
Mira Murati宣布成立Thinking Machines Lab,这是一个专注于多模态AI、定制模型和开放科学的新项目,同时还推出了一款名为Tinker的工具,用于训练开放权重模型。
这篇论文介绍了Audex,这是NVIDIA推出的统一音频-文本大语言模型,在多种音频和语音任务上实现了最先进的性能,同时保持了强大的文本推理能力,且没有出现退化。
Victoria Lin's Stanford CS25 lecture discusses the paradigm shift from language models to native multimodal intelligence, covering tokenization approaches and comparing models like Chameleon and Transfusion.
该推文强调了多模态AI智能体(如Nano Banana 2 Lite:每张图片约3美分,约4秒;Gemini Omni Flash:视频每秒0.10美元,支持原生音频和编辑)惊人的低成本和高速,使智能体循环运行变得非常便宜。
奥里奥尔·维尼亚尔斯(Oriol Vinyals)关于 Google Gemini 模型、世界模型、多模态 AI、智能体以及持续学习和真正创新等挑战的讨论摘要。
本文基于研究者Victoria Lin的分享,系统梳理了原生多模态大模型的主流技术路线(Chameleon、Transfusion、MOT)及其优缺点,指出多模态AI仍处于早期探索阶段,存在缩放定律空白、图像理解与生成编码不统一、与物理世界对接等开放问题。
本文讨论了生成式AI产品从孤立的单能力模型演变为集成工作流生态系统的趋势,这些系统捆绑了音乐、视频、语音和编辑工具,尽管在模型质量上有所折衷,但可能减少创作者的工作流碎片化。
Magma 是微软研究院推出的一个开源仓库,用于构建整合视觉、语言和行动的多模态 AI 智能体,提供模型链接、推理示例、训练说明和演示。
Mira Murati 的创业公司 Thinking Machines Lab 预告了一种新的‘交互模式’,该模式能够原生理解连续的人类交流,旨在随着 AI 向超级智能迈进时,让人类始终参与其中。
本文提出了一个针对医疗保健领域生成式、多模态及智能体AI进行基准测试的结构化框架,旨在解决高基准得分与实际临床可靠性、安全性和相关性之间的差距。
本文介绍了 EmoS,这是一个专为细粒度流式情感理解设计的高保真多模态基准,旨在解决现有数据集中存在的生态效度不足和标注可靠性低的问题。
本文介绍了 UniCharacter,这是一个用于定制化多模态角色扮演(CMRP)的两阶段训练框架,能够对人设、对话风格和视觉身份进行统一的定制。该研究提出了 RoleScape-20 数据集,并证明了该模型仅需极少数据即可实现连贯的跨模态生成。
本文介绍了 SenseNova-U1,这是一种统一的多模态架构,整合了理解与生成任务。我们发布了两个变体(8B 和 30B),在感知能力和图像合成方面均表现出竞争力的性能。
本文讨论了多模态 AI 模型(如 GPT-4o 和 Claude 3.5 Sonnet)如何通过支持可视化调试、音频转数据以及增强型 RAG 系统,来克服纯文本处理的瓶颈。
本文介绍了结构化角色感知策略优化(SRPO),该方法通过在大视觉-语言模型的强化学习框架内,根据感知和推理的不同角色分配令牌级信用,从而提升多模态推理能力。
本文提出了正负解码(PND),这是一种无需训练的推理框架,通过在解码过程中对比正向视觉证据与负向反事实来减少视觉-语言模型中的对象幻觉。
Qwen-Image-2.0 是一个全新的图像生成基础模型,基于 Qwen3-VL 和多模态扩散 Transformer,将高保真合成与精确编辑能力统一起来。它在富含文本的内容、多语言排版以及照片级真实感生成方面表现卓越。
The user shares an impressive example of a 3D biological structure page generated using GPT Image 2 and Gemini 3.1 Pro, noting its potential for AI education and expressing intent to replicate it.