visual-generation

标签

Cards List
#visual-generation

OmniHarness:通过符号策略学习实现可泛化的视觉生成

arXiv cs.LG · 3天前 缓存

OmniHarness 引入了一个基于符号策略学习的可泛化视觉生成框架,解决了多模态大型语言模型和多智能体系统的局限性,并在如 ComfyBench 等基准测试中表现出色。

0 人收藏 0 人点赞
#visual-generation

@JenovaAIAgent:隆重介绍 Crystal Ball Reader——这款 AI 智能体能够将您的疑问转化为水晶球内的电影般视觉画面…

X AI KOLs Following · 2026-09-08 缓存

本文介绍了 Crystal Ball Reader,这是一款 AI 智能体,它能将用户提出的问题转化为水晶球内的动态视觉场景,助力用户做出更明智的决策。

0 人收藏 0 人点赞
#visual-generation

智能体视觉生成:从生成模型到智能体控制

Hugging Face Daily Papers · 2026-09-06 缓存

本文提出一个四级框架,根据控制器对生成操作的直接决策范围,将智能体视觉生成系统分类,从固定支持到经验自适应控制。

0 人收藏 0 人点赞
#visual-generation

@JenovaAIAgent: Comic Creator 是一个AI代理,它逐页构建完整的漫画——从单期问题到200页的图画小说……

X AI KOLs Following · 2026-09-04 缓存

Comic Creator 是一个AI代理,它确保漫画页面间的角色与风格一致性,从而能够创作出包含艺术与对话的完整漫画,从单期问题到长篇图画小说。

0 人收藏 0 人点赞
#visual-generation

@songhan_mit: 十年,同一个问题,但更难的版本。Jun-Yan 一直在推动视觉生成的前沿——某人…

X AI KOLs Timeline · 2026-09-04 缓存

Jun-Yan Zhu 宣布推出 Nunchux AI,一家专注于视觉生成的公司,这标志着自他在 CycleGAN 等有影响力模型上的工作以来已过去十年。

0 人收藏 0 人点赞
#visual-generation

在原生统一多模态模型中揭示理解-生成协同:从表示、任务到系统

Hugging Face Daily Papers · 2026-09-01 缓存

本文探讨了统一多模态模型中视觉理解与生成之间的协同效应,表明任务解耦架构和端到端优化可以通过将共存转化为协同来提升性能。

0 人收藏 0 人点赞
#visual-generation

AdvFD:通过对抗式弗雷歇距离损失提升视觉生成

Hugging Face Daily Papers · 2026-08-11 缓存

本文介绍了对抗式弗雷歇距离(AdvFD),它在静态弗雷歇损失的基础上增加了一个可学习的对抗性特征空间,以改进生成器的后训练,并通过真实特征白化来稳定优化过程。

0 人收藏 0 人点赞
#visual-generation

@rohanpaul_ai: 更长的提示词并不是图像生成器所需要的。文生图模型似乎更多受到提示词如何清晰地展现场景的约束,而非提示词长度的影响……

X AI KOLs Following · 2026-08-05 缓存

一篇新论文认为,文生图模型从更长的提示词中获益较少,而更多受益于明确组织的视觉结构,提出使用结构化提示词而非自然语言散文。

0 人收藏 0 人点赞
#visual-generation

视觉生成中文本条件化的缩放特性

Hugging Face Daily Papers · 2026-07-31 缓存

本文研究了视觉生成中文本条件化的经验缩放特性,表明收敛的扩散损失随提示中的结构化语言而变化,并引入了改进可扩散性和可提示性的方法。

0 人收藏 0 人点赞
#visual-generation

Chimera:混合视觉扩散Transformer的设计与Chinchilla式缩放

Hugging Face Daily Papers · 2026-07-30 缓存

本文介绍了Chimera,一种具有原则性缩放方案的混合视觉扩散骨干网络,结合了Kimi Delta Attention、多头潜在注意力和稀疏混合专家,以高效处理长上下文图像和视频生成。它还提出了HeteroP,一种模块级超参数迁移方案,以及Chinchilla式缩放定律,用于训练一个具有20亿激活参数的110亿参数模型。

0 人收藏 0 人点赞
#visual-generation

超越可教知识的搜索:发展智能体视觉生成中的知识边界

Hugging Face Daily Papers · 2026-07-09 缓存

本文通过引入SearchGen-20K基准和SearchGen-Corpus-1M语料库,解决了视觉生成中的知识边界问题,并提出了一种先教后搜索的协同训练框架,以处理超出生成器训练数据的、不断演化的长尾用户请求。

0 人收藏 0 人点赞
#visual-generation

通过分布级奖励优化视觉生成模型

Hugging Face Daily Papers · 2026-07-02 缓存

本文提出一种用于视觉生成模型的强化学习框架,该框架使用分布级奖励,并采用子集替换策略以提高效率,在改善图像多样性和质量的同时,解决模式崩溃和奖励破解问题。

0 人收藏 0 人点赞
#visual-generation

面向一步式视觉生成的表示分布匹配

Hugging Face Daily Papers · 2026-07-02 缓存

本文介绍了表示分布匹配(RDM),一种通过匹配预训练编码器下的特征分布来实现一步式图像生成的方法,在ImageNet上取得了最先进的结果,并能够将FLUX.2后训练为性能提升的一步生成器。

0 人收藏 0 人点赞
#visual-generation

聚焦关键:扩散MoE中利用显著性的精准路由

Hugging Face Daily Papers · 2026-06-25 缓存

SharpMoE是一个后训练框架,通过使用干净的潜在特征识别显著令牌和轨迹路由损失来精确分配计算资源,改进扩散混合专家模型中的路由,实现了最先进的视觉生成。

0 人收藏 0 人点赞
#visual-generation

@drfeifei: 我非常兴奋于这个适用于大规模生成模型新时代的视觉生成新基准数据集…

X AI KOLs Following · 2026-05-29 缓存

介绍GPIC(Giant Permissive Image Corpus),一个大规模数据集,包含1亿个VLM标注的图像-文本对用于训练,以及100万个用于基准测试的对,完全许可用于研究和商业用途。

0 人收藏 0 人点赞
#visual-generation

通过闭环验证推理解锁复杂视觉生成

Hugging Face Daily Papers · 2026-05-14 缓存

介绍CLVR(闭环视觉推理),一种将文本到图像生成从单步过程重构为闭环多步视觉推理方法的框架,使用VLM控制器和扩散模型,在组合提示上实现了改进的性能。

0 人收藏 0 人点赞
#visual-generation

Codex for Creatives: Riff, Design, Ship

YouTube AI Channels · 2026-06-12 缓存

OpenAI's Codex, typically used for coding, can also serve as a creative partner for generating brand ad campaigns by understanding style guides and emotional prompts, as demonstrated by creative specialist Shad Nelson.

0 人收藏 0 人点赞
← 返回首页

提交意见反馈