multimodal-generation

标签

Cards List
#multimodal-generation

视觉作为统一多模态生成

Hugging Face Daily Papers · 2026-07-07 缓存

本文介绍 SenseNova-Vision,一个统一的多模态模型,将计算机视觉任务表述为生成问题,在多种视觉任务上实现了与专用系统相当的性能。它引入了一个大规模指令-响应语料库,并公开发布模型和数据集。

0 人收藏 0 人点赞
#multimodal-generation

PairCoder++:结对编程作为已验证代码驱动的多模态与结构化工件生成的通用范式

arXiv cs.CL · 2026-07-03 缓存

PairCoder++ 提出了一种结对编程范式,其中 Driver 代理编写代码,Navigator 代理利用工具链验证进行审查。在 17 个基准测试中,该方法在生成图表、科学图像、CAD 模型、3D 场景及其他结构化工件方面取得了显著改进。

0 人收藏 0 人点赞
#multimodal-generation

引导用户行为实现个性化多模态生成

arXiv cs.AI · 2026-06-24 缓存

本文提出NaviGen框架,通过双标识符和两阶段SFT+RL流水线将用户行为编码为可执行指令,实现个性化多模态内容生成,在商品、游戏和短视频领域提升了个性化效果。

0 人收藏 0 人点赞
#multimodal-generation

TIGER:基于图证据路由的可追溯推理,用于减轻多模态生成中的幻觉

arXiv cs.AI · 2026-06-02 缓存

TIGER是一个推理时框架,通过提取观察图和声明图并分配风险评分来修复不支持的事实,从而减轻多模态生成中的幻觉。它在图像到文本、图像+文本到文本、音频到文本和视频到文本任务中减少了不支持的内容。

0 人收藏 0 人点赞
#multimodal-generation

AlphaGRPO:通过分解可验证奖励释放统一多模态模型中的自反式生成能力

Hugging Face Daily Papers · 2026-05-12 缓存

AlphaGRPO 是一个新框架,将组相对策略优化(Group Relative Policy Optimization)应用于统一多模态模型(UMMs),通过自反式精炼和分解可验证奖励来增强生成效果。

0 人收藏 0 人点赞
#multimodal-generation

STARFlow2:连接语言模型与归一化流以实现统一的多模态生成

Hugging Face Daily Papers · 2026-05-08 缓存

STARFlow2 是一项新的研究论文,介绍了一种将语言模型与自回归归一化流相结合的架构,用于统一的多模态生成。它通过使用共享的因果掩码机制处理交错的文本-图像序列,解决了现有系统中的结构不匹配问题。

0 人收藏 0 人点赞
#multimodal-generation

MM-WebAgent: 一种用于网页生成的分层多模态Web智能体

Hugging Face Daily Papers · 2026-04-16 缓存

MM-WebAgent是一种分层智能体框架,通过联合优化布局和多模态内容来协调基于AIGC的元素生成,从而生成连贯且视觉一致的网页。本文引入了一个基准测试和多级评估协议,展示了该框架相比代码生成和基于智能体的基线方法的改进。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈