visual-generation

标签

Cards List
#visual-generation

Chimera:混合视觉扩散Transformer的设计与Chinchilla式缩放

Hugging Face Daily Papers · 昨天 缓存

本文介绍了Chimera,一种具有原则性缩放方案的混合视觉扩散骨干网络,结合了Kimi Delta Attention、多头潜在注意力和稀疏混合专家,以高效处理长上下文图像和视频生成。它还提出了HeteroP,一种模块级超参数迁移方案,以及Chinchilla式缩放定律,用于训练一个具有20亿激活参数的110亿参数模型。

0 人收藏 0 人点赞
#visual-generation

超越可教知识的搜索:发展智能体视觉生成中的知识边界

Hugging Face Daily Papers · 2026-07-09 缓存

本文通过引入SearchGen-20K基准和SearchGen-Corpus-1M语料库,解决了视觉生成中的知识边界问题,并提出了一种先教后搜索的协同训练框架,以处理超出生成器训练数据的、不断演化的长尾用户请求。

0 人收藏 0 人点赞
#visual-generation

通过分布级奖励优化视觉生成模型

Hugging Face Daily Papers · 2026-07-02 缓存

本文提出一种用于视觉生成模型的强化学习框架,该框架使用分布级奖励,并采用子集替换策略以提高效率,在改善图像多样性和质量的同时,解决模式崩溃和奖励破解问题。

0 人收藏 0 人点赞
#visual-generation

面向一步式视觉生成的表示分布匹配

Hugging Face Daily Papers · 2026-07-02 缓存

本文介绍了表示分布匹配(RDM),一种通过匹配预训练编码器下的特征分布来实现一步式图像生成的方法,在ImageNet上取得了最先进的结果,并能够将FLUX.2后训练为性能提升的一步生成器。

0 人收藏 0 人点赞
#visual-generation

聚焦关键:扩散MoE中利用显著性的精准路由

Hugging Face Daily Papers · 2026-06-25 缓存

SharpMoE是一个后训练框架,通过使用干净的潜在特征识别显著令牌和轨迹路由损失来精确分配计算资源,改进扩散混合专家模型中的路由,实现了最先进的视觉生成。

0 人收藏 0 人点赞
#visual-generation

@drfeifei: 我非常兴奋于这个适用于大规模生成模型新时代的视觉生成新基准数据集…

X AI KOLs Following · 2026-05-29 缓存

介绍GPIC(Giant Permissive Image Corpus),一个大规模数据集,包含1亿个VLM标注的图像-文本对用于训练,以及100万个用于基准测试的对,完全许可用于研究和商业用途。

0 人收藏 0 人点赞
#visual-generation

通过闭环验证推理解锁复杂视觉生成

Hugging Face Daily Papers · 2026-05-14 缓存

介绍CLVR(闭环视觉推理),一种将文本到图像生成从单步过程重构为闭环多步视觉推理方法的框架,使用VLM控制器和扩散模型,在组合提示上实现了改进的性能。

0 人收藏 0 人点赞
#visual-generation

Codex for Creatives: Riff, Design, Ship

YouTube AI Channels · 2026-06-12 缓存

OpenAI's Codex, typically used for coding, can also serve as a creative partner for generating brand ad campaigns by understanding style guides and emotional prompts, as demonstrated by creative specialist Shad Nelson.

0 人收藏 0 人点赞
← 返回首页

提交意见反馈