标签
本文介绍 SenseNova-Vision,一个统一的多模态模型,将计算机视觉任务表述为生成问题,在多种视觉任务上实现了与专用系统相当的性能。它引入了一个大规模指令-响应语料库,并公开发布模型和数据集。
PairCoder++ 提出了一种结对编程范式,其中 Driver 代理编写代码,Navigator 代理利用工具链验证进行审查。在 17 个基准测试中,该方法在生成图表、科学图像、CAD 模型、3D 场景及其他结构化工件方面取得了显著改进。
本文提出NaviGen框架,通过双标识符和两阶段SFT+RL流水线将用户行为编码为可执行指令,实现个性化多模态内容生成,在商品、游戏和短视频领域提升了个性化效果。
TIGER是一个推理时框架,通过提取观察图和声明图并分配风险评分来修复不支持的事实,从而减轻多模态生成中的幻觉。它在图像到文本、图像+文本到文本、音频到文本和视频到文本任务中减少了不支持的内容。
AlphaGRPO 是一个新框架,将组相对策略优化(Group Relative Policy Optimization)应用于统一多模态模型(UMMs),通过自反式精炼和分解可验证奖励来增强生成效果。
STARFlow2 是一项新的研究论文,介绍了一种将语言模型与自回归归一化流相结合的架构,用于统一的多模态生成。它通过使用共享的因果掩码机制处理交错的文本-图像序列,解决了现有系统中的结构不匹配问题。
MM-WebAgent是一种分层智能体框架,通过联合优化布局和多模态内容来协调基于AIGC的元素生成,从而生成连贯且视觉一致的网页。本文引入了一个基准测试和多级评估协议,展示了该框架相比代码生成和基于智能体的基线方法的改进。