controllable-generation

标签

Cards List
#controllable-generation

外观指针——扩散变换器的多模态区域控制

Hugging Face Daily Papers · 2026-07-21 缓存

介绍了外观指针,这是一种紧凑的标记,能够引导扩散变换器在指定空间位置应用正确的外观提示,从而无需重新训练基础模型即可实现模态无关的局部多模态控制。

0 人收藏 0 人点赞
#controllable-generation

从文字到控件:实现可控的LLM生成

arXiv cs.CL · 2026-07-15 缓存

可塑提示(Malleable Prompting)是一种新颖的交互技术,它将自然语言偏好具体化为GUI控件(滑块、开关、下拉菜单)以供直接操作,并配有解码算法,该算法根据控件值调节词元概率,从而实现对LLM生成的精确控制。一项用户研究表明,在精确性、可控性和透明度方面,它优于纯自然语言提示。

0 人收藏 0 人点赞
#controllable-generation

@volokuleshov: 新博客文章:如何构建扩散语言模型。扩散LLM从开放问题变为现实,用了2年时间 (Me…)

X AI KOLs Timeline · 2026-07-08 缓存

由Volodymyr Kuleshov的康奈尔团队撰写的综合博客文章,解释了如何构建扩散语言模型,涵盖了核心技术如掩码扩散、迭代细化、变长生成、可控生成、快速采样器和RL后训练,并以开源模型如Mercury、Gemma Diffusion和Nemotron Diffusion为例。

0 人收藏 0 人点赞
#controllable-generation

CONFLUX:一种用于3D胸部CT合成的潜在扩散模型,采用强化学习后训练

Hugging Face Daily Papers · 2026-07-03 缓存

CONFLUX是一种用于胸部CT合成的3D潜在扩散模型,能够实现高保真的体积生成,并具有可控的临床属性。通过强化学习后训练阶段增强了条件生成的可靠性。该模型及一个包含约20万胸部CT体积的合成数据集已发布。

0 人收藏 0 人点赞
#controllable-generation

用于临床培训的法语OSCE对话数据集与可控虚拟患者系统

arXiv cs.CL · 2026-06-30 缓存

本文介绍了一个包含240次交互的法语OSCE对话数据集,以及一个基于可控LLM的流水线,用于生成合成OSCE对话,从而实现医学培训中带有自动反馈的逼真虚拟患者模拟。

0 人收藏 0 人点赞
#controllable-generation

InstanceControl:无需实例标注的可控复杂图像生成

Hugging Face Daily Papers · 2026-06-30 缓存

InstanceControl利用视觉语言模型在文本提示与视觉条件之间建立实例级对应,无需人工实例标注即可实现多实例可控图像生成,并通过自适应掩码优化提高准确性。

0 人收藏 0 人点赞
#controllable-generation

LISA: 面向视觉条件可控生成的似然分数对齐

Hugging Face Daily Papers · 2026-06-25 缓存

本文介绍了LISA,一种正则化方法,它将侧网络的中间特征与近似的似然分数对齐,以提高基于分数的生成模型中视觉条件可控生成的训练效率和质量。

0 人收藏 0 人点赞
#controllable-generation

Arbor:面向可控3D资产生成的显式几何条件化方法

Hugging Face Daily Papers · 2026-06-22 缓存

Arbor通过使用约束网格(壳体、避让、接触区域)对潜在生成进行条件化,为3D资产生成引入了显式几何控制,在不牺牲物体质量的前提下提升了空间约束的遵从性。

0 人收藏 0 人点赞
#controllable-generation

Holo-World:面向视频世界模型的统一相机、物体与天气控制

Hugging Face Daily Papers · 2026-06-18 缓存

Holo-World 提出了一种统一的可控视频世界模型,能够从单张图像生成视频,并显式控制相机、物体运动与天气。该工作引入了一个新颖的数据集与技术,可在将场景迁移至目标天气状态的同时保持场景结构。

0 人收藏 0 人点赞
#controllable-generation

SciR:用于LLMs科学推理的可控基准

arXiv cs.AI · 2026-06-12 缓存

SciR是一种新的可控基准,用于评估LLMs在科学推理方面的能力,包括演绎、归纳和因果溯因,并通过参数控制提取难度和推理难度。测试表明,两个难度轴都会降低所有模型的性能,推理模型(如DeepSeek-R1)在推理方面优于指令模型。

0 人收藏 0 人点赞
#controllable-generation

AirfoilGen:一种构造有效且性能感知的翼型潜扩散模型

arXiv cs.LG · 2026-05-21 缓存

本文提出AirfoilGen,一种用于翼型形状生成的潜扩散模型,通过圆形扫掠表示确保几何有效性,并能够控制气动性能(升力/阻力系数)。实验表明,使用超过20万个翼型的新数据集,性能条件化准确率达到98.41%。

0 人收藏 0 人点赞
#controllable-generation

CogOmniControl: 基于推理的可控视频生成,通过创意意图认知

Hugging Face Daily Papers · 2026-05-19 缓存

CogOmniControl是一个基于推理的可控视频生成框架,它使用在动画制作数据上训练的专业视觉语言模型(CogVLM)从稀疏条件中推断创意意图,然后通过强化学习引导基于扩散的生成器,在新基准上取得最先进的结果。

0 人收藏 0 人点赞
#controllable-generation

可控分子生成基础模型

arXiv cs.LG · 2026-05-18 缓存

提出CoMole,一种基于基序感知图扩散和强化学习的可控分子生成基础模型,在材料和药物发现基准测试中实现了卓越的可控性。

0 人收藏 0 人点赞
#controllable-generation

遵循均值:参考引导的流匹配

Hugging Face Daily Papers · 2026-05-12 缓存

本文介绍了一种在流匹配中实现可控生成的方法,通过使用参考集调整条件端点均值,提供了无需训练和半参数化的指导方式,用于风格和内容控制。

0 人收藏 0 人点赞
#controllable-generation

ReImagine:以图像为先的可控高质量人体视频生成新思路

Hugging Face Daily Papers · 2026-04-21 缓存

ReImagine 提出“图像优先”的可控高质量人体视频生成方案,借助 SMPL-X 动作引导与视频扩散模型,将外观建模与时间一致性解耦。

0 人收藏 0 人点赞
#controllable-generation

AutoFigure: 生成与精炼可出版的科学插图

Papers with Code Trending · 2026-02-03 缓存

AutoFigure是一个开源系统,用于生成和精炼可编辑、适合出版的科学图表,已被ICLR 2026接收。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈