multimodal-ai

标签

Cards List
#multimodal-ai

ICDAR 2026 原子层沉积/刻蚀(ALD/E)科学图表信息提取竞赛

Hugging Face Daily Papers · 2026-07-29 缓存

本文介绍了ICDAR 2026原子层沉积/刻蚀(ALD/E)科学图表信息提取竞赛,提出了包含四个互补任务的Sci-ImageMiner基准数据集。结果表明,最先进的多模态模型在分类和摘要任务上表现良好,但在数据提取和科学推理方面存在困难,尤其是在视觉问答任务中。

0 人收藏 0 人点赞
#multimodal-ai

@PyTorch: 作为@AMD AI DevMaster黑客马拉松官方推荐框架,PyTorch使开发者能够构建AI应用…

X AI KOLs Timeline · 2026-07-22 缓存

AMD AI DevMaster黑客马拉松于2026年7月10日至8月6日举行,设有三个赛道(多模态AI、智能体AI、物理AI)和30,000美元奖金池,PyTorch作为ROCm支持的AMD GPU上的官方框架。

0 人收藏 0 人点赞
#multimodal-ai

@miramurati:一年前,我们致力于通过多模态AI、定制模型和开放科学来增强人类能力。我们预览了……

X AI KOLs Following · 2026-07-10 缓存

Mira Murati宣布成立Thinking Machines Lab,这是一个专注于多模态AI、定制模型和开放科学的新项目,同时还推出了一款名为Tinker的工具,用于训练开放权重模型。

0 人收藏 0 人点赞
#multimodal-ai

统一音频智能,且不牺牲文本智能

Hugging Face Daily Papers · 2026-07-06 缓存

这篇论文介绍了Audex,这是NVIDIA推出的统一音频-文本大语言模型,在多种音频和语音任务上实现了最先进的性能,同时保持了强大的文本推理能力,且没有出现退化。

0 人收藏 0 人点赞
#multimodal-ai

@VictoriaLinML: The video of my Stanford CS25 guest lecture, From Language Models to Native Multimodal Intelligence, is now online. I d…

X AI KOLs Timeline · 2026-07-03 缓存

Victoria Lin's Stanford CS25 lecture discusses the paradigm shift from language models to native multimodal intelligence, covering tokenization approaches and comparing models like Chameleon and Transfusion.

0 人收藏 0 人点赞
#multimodal-ai

@Saboo_Shubham_: 多模态AI智能体的成本低到离谱。Nano Banana 2 Lite:每张图片约3美分,每张约4秒。Gemini Omni F…

X AI KOLs Timeline · 2026-06-30 缓存

该推文强调了多模态AI智能体(如Nano Banana 2 Lite:每张图片约3美分,约4秒;Gemini Omni Flash:视频每秒0.10美元,支持原生音频和编辑)惊人的低成本和高速,使智能体循环运行变得非常便宜。

0 人收藏 0 人点赞
#multimodal-ai

摘要:Gemini 联合负责人谈世界模型、强化学习的下一个领域与持续学习

Reddit r/artificial · 2026-06-25 缓存

奥里奥尔·维尼亚尔斯(Oriol Vinyals)关于 Google Gemini 模型、世界模型、多模态 AI、智能体以及持续学习和真正创新等挑战的讨论摘要。

1 人收藏 1 人点赞
#multimodal-ai

@seclink: https://x.com/seclink/status/2067968283492712846

X AI KOLs Following · 2026-06-19 缓存

本文基于研究者Victoria Lin的分享,系统梳理了原生多模态大模型的主流技术路线(Chameleon、Transfusion、MOT)及其优缺点,指出多模态AI仍处于早期探索阶段,存在缩放定律空白、图像理解与生成编码不统一、与物理世界对接等开放问题。

0 人收藏 0 人点赞
#multimodal-ai

AI音乐生成、AI视频工具和语音AI正缓慢融合成一个生态系统

Reddit r/ArtificialInteligence · 2026-05-25

本文讨论了生成式AI产品从孤立的单能力模型演变为集成工作流生态系统的趋势,这些系统捆绑了音乐、视频、语音和编辑工具,尽管在模型质量上有所折衷,但可能减少创作者的工作流碎片化。

0 人收藏 0 人点赞
#multimodal-ai

@DanKornas:大多数 AI 智能体仍然将视觉、语言和行动分离到不同的系统中。Magma 是微软研究院的一个基础…

X AI KOLs Timeline · 2026-05-23 缓存

Magma 是微软研究院推出的一个开源仓库,用于构建整合视觉、语言和行动的多模态 AI 智能体,提供模型链接、推理示例、训练说明和演示。

0 人收藏 0 人点赞
#multimodal-ai

Mira Murati 希望她的 AI 能‘让人类参与其中’

Wired · 2026-05-15 缓存

Mira Murati 的创业公司 Thinking Machines Lab 预告了一种新的‘交互模式’,该模式能够原生理解连续的人类交流,旨在随着 AI 向超级智能迈进时,让人类始终参与其中。

0 人收藏 0 人点赞
#multimodal-ai

衡量关键指标:医疗保健中生成式、多模态及智能体AI的基准测试

arXiv cs.AI · 2026-05-12 缓存

本文提出了一个针对医疗保健领域生成式、多模态及智能体AI进行基准测试的结构化框架,旨在解决高基准得分与实际临床可靠性、安全性和相关性之间的差距。

0 人收藏 0 人点赞
#multimodal-ai

EmoS:面向细粒度流式情感理解的高保真多模态基准

arXiv cs.CL · 2026-05-12 缓存

本文介绍了 EmoS,这是一个专为细粒度流式情感理解设计的高保真多模态基准,旨在解决现有数据集中存在的生态效度不足和标注可靠性低的问题。

0 人收藏 0 人点赞
#multimodal-ai

迈向定制化的多模态角色扮演

arXiv cs.LG · 2026-05-12 缓存

本文介绍了 UniCharacter,这是一个用于定制化多模态角色扮演(CMRP)的两阶段训练框架,能够对人设、对话风格和视觉身份进行统一的定制。该研究提出了 RoleScape-20 数据集,并证明了该模型仅需极少数据即可实现连贯的跨模态生成。

0 人收藏 0 人点赞
#multimodal-ai

SenseNova-U1:基于 NEO-unify 架构统一多模态理解与生成

Hugging Face Daily Papers · 2026-05-12 缓存

本文介绍了 SenseNova-U1,这是一种统一的多模态架构,整合了理解与生成任务。我们发布了两个变体(8B 和 30B),在感知能力和图像合成方面均表现出竞争力的性能。

0 人收藏 0 人点赞
#multimodal-ai

通过多模态突破纯文本瓶颈?

Reddit r/AI_Agents · 2026-05-11

本文讨论了多模态 AI 模型(如 GPT-4o 和 Claude 3.5 Sonnet)如何通过支持可视化调试、音频转数据以及增强型 RAG 系统,来克服纯文本处理的瓶颈。

0 人收藏 0 人点赞
#multimodal-ai

面向多模态推理的结构化角色感知策略优化

arXiv cs.AI · 2026-05-11 缓存

本文介绍了结构化角色感知策略优化(SRPO),该方法通过在大视觉-语言模型的强化学习框架内,根据感知和推理的不同角色分配令牌级信用,从而提升多模态推理能力。

0 人收藏 0 人点赞
#multimodal-ai

打破幻觉:多模态解码中正负信号的博弈

arXiv cs.LG · 2026-05-11 缓存

本文提出了正负解码(PND),这是一种无需训练的推理框架,通过在解码过程中对比正向视觉证据与负向反事实来减少视觉-语言模型中的对象幻觉。

0 人收藏 0 人点赞
#multimodal-ai

Qwen-Image-2.0 技术报告

Hugging Face Daily Papers · 2026-05-11 缓存

Qwen-Image-2.0 是一个全新的图像生成基础模型,基于 Qwen3-VL 和多模态扩散 Transformer,将高保真合成与精确编辑能力统一起来。它在富含文本的内容、多语言排版以及照片级真实感生成方面表现卓越。

0 人收藏 0 人点赞
#multimodal-ai

@LufzzLiz: 卧靠,这个好棒啊。 GPT image 2 + Gemini 3.1 pro生成的3D生物结构页面 有利于AI教育,我要复刻一下~

X AI KOLs Timeline · 2026-05-10 缓存

The user shares an impressive example of a 3D biological structure page generated using GPT Image 2 and Gemini 3.1 Pro, noting its potential for AI education and expressing intent to replicate it.

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈