标签
介绍了外观指针,这是一种紧凑的标记,能够引导扩散变换器在指定空间位置应用正确的外观提示,从而无需重新训练基础模型即可实现模态无关的局部多模态控制。
可塑提示(Malleable Prompting)是一种新颖的交互技术,它将自然语言偏好具体化为GUI控件(滑块、开关、下拉菜单)以供直接操作,并配有解码算法,该算法根据控件值调节词元概率,从而实现对LLM生成的精确控制。一项用户研究表明,在精确性、可控性和透明度方面,它优于纯自然语言提示。
由Volodymyr Kuleshov的康奈尔团队撰写的综合博客文章,解释了如何构建扩散语言模型,涵盖了核心技术如掩码扩散、迭代细化、变长生成、可控生成、快速采样器和RL后训练,并以开源模型如Mercury、Gemma Diffusion和Nemotron Diffusion为例。
CONFLUX是一种用于胸部CT合成的3D潜在扩散模型,能够实现高保真的体积生成,并具有可控的临床属性。通过强化学习后训练阶段增强了条件生成的可靠性。该模型及一个包含约20万胸部CT体积的合成数据集已发布。
本文介绍了一个包含240次交互的法语OSCE对话数据集,以及一个基于可控LLM的流水线,用于生成合成OSCE对话,从而实现医学培训中带有自动反馈的逼真虚拟患者模拟。
InstanceControl利用视觉语言模型在文本提示与视觉条件之间建立实例级对应,无需人工实例标注即可实现多实例可控图像生成,并通过自适应掩码优化提高准确性。
本文介绍了LISA,一种正则化方法,它将侧网络的中间特征与近似的似然分数对齐,以提高基于分数的生成模型中视觉条件可控生成的训练效率和质量。
Arbor通过使用约束网格(壳体、避让、接触区域)对潜在生成进行条件化,为3D资产生成引入了显式几何控制,在不牺牲物体质量的前提下提升了空间约束的遵从性。
Holo-World 提出了一种统一的可控视频世界模型,能够从单张图像生成视频,并显式控制相机、物体运动与天气。该工作引入了一个新颖的数据集与技术,可在将场景迁移至目标天气状态的同时保持场景结构。
SciR是一种新的可控基准,用于评估LLMs在科学推理方面的能力,包括演绎、归纳和因果溯因,并通过参数控制提取难度和推理难度。测试表明,两个难度轴都会降低所有模型的性能,推理模型(如DeepSeek-R1)在推理方面优于指令模型。
本文提出AirfoilGen,一种用于翼型形状生成的潜扩散模型,通过圆形扫掠表示确保几何有效性,并能够控制气动性能(升力/阻力系数)。实验表明,使用超过20万个翼型的新数据集,性能条件化准确率达到98.41%。
CogOmniControl是一个基于推理的可控视频生成框架,它使用在动画制作数据上训练的专业视觉语言模型(CogVLM)从稀疏条件中推断创意意图,然后通过强化学习引导基于扩散的生成器,在新基准上取得最先进的结果。
提出CoMole,一种基于基序感知图扩散和强化学习的可控分子生成基础模型,在材料和药物发现基准测试中实现了卓越的可控性。
本文介绍了一种在流匹配中实现可控生成的方法,通过使用参考集调整条件端点均值,提供了无需训练和半参数化的指导方式,用于风格和内容控制。
ReImagine 提出“图像优先”的可控高质量人体视频生成方案,借助 SMPL-X 动作引导与视频扩散模型,将外观建模与时间一致性解耦。
AutoFigure是一个开源系统,用于生成和精炼可编辑、适合出版的科学图表,已被ICLR 2026接收。