generation

标签

Cards List
#generation

Represent, Then Generate: Multimodal-Conditioned Time-Series Generation under Irregular Missingness

arXiv cs.LG · 2026-08-14 缓存

Proposes ReCoGen, a two-stage framework for multimodal-conditioned time-series generation under irregular missingness, achieving state-of-the-art downstream utility on physiological benchmarks.

0 人收藏 0 人点赞
#generation

论多语言文本到图像生成中跨语言一致性的局限性

arXiv cs.CL · 2026-08-12 缓存

本文介绍了LingT2I,这是一个覆盖10种语言、包含33K个提示词的基准,用于评估文本到图像生成中的跨语言一致性,揭示了内容生成和文本渲染方面的语言不平等及语言依赖的权衡。

0 人收藏 0 人点赞
#generation

RA-CAD:为状态感知的文本到CAD生成学习执行后批判

arXiv cs.AI · 2026-08-07 缓存

RA-CAD 提出了一种用于文本到CAD生成的状态感知智能体,采用生成-执行-批判-重写循环,并通过组相对策略优化进行反馈驱动的智能体优化。它在CADFusion和Text2CAD基准上实现了最先进的执行有效性和几何质量。

0 人收藏 0 人点赞
#generation

TraceCAD:面向智能体CAD生成的可追踪引导修复

arXiv cs.AI · 2026-08-05 缓存

TraceCAD是面向基于LLM的CAD智能体的持久化恢复层,用于诊断错误操作并执行局部化、可复用的修复,以提升最终几何质量与修复可靠性。

0 人收藏 0 人点赞
#generation

MotifRole-Diff: 面向掩码分子图扩散的风险最优角色感知破坏

arXiv cs.LG · 2026-07-27 缓存

MotifRole-Diff提出了一种用于分子图上掩码离散扩散的角色感知破坏调度,根据去噪难度和图级扰动影响分配掩码率,在QM9和MOSES基准测试上展示了改进的有效性和降低的FCD。

0 人收藏 0 人点赞
#generation

介绍 ASCIITermDraw Bench | 测试视觉语言模型生成和编辑 ASCII 艺术的能力

Reddit r/ArtificialInteligence · 2026-07-22

介绍 ASCIITermDraw Bench,这是一个用于评估视觉语言模型在 ASCII 艺术生成与编辑任务上的基准测试。

0 人收藏 0 人点赞
#generation

SciForma:科学图表的结构忠实生成

Hugging Face Daily Papers · 2026-07-20 缓存

介绍了SciForma,一个用于生成具有高结构保真度的科学方法图表的框架,使用多维联合偏好优化(M-DPO)和结构清单来确保在组件、箭头和文本轴上的正确性。该9B模型在基准评估上超越了开源基线和GPT-Image-1.5。

0 人收藏 0 人点赞
#generation

@charliermarsh: 第一眼看上去令人印象深刻,但我很确定这个克莱因瓶在训练数据中。

X AI KOLs Following · 2026-07-19 缓存

一条推文讨论了Claude Fable 5 Max在克莱因瓶上生成一个宝可梦填字游戏,但表达了怀疑,认为模型可能从训练数据中记住了这个设计。

0 人收藏 0 人点赞
#generation

中国已具备制作高度逼真的1分钟AI视频能力

Reddit r/ArtificialInteligence · 2026-07-16

中国已开发出生成最长一分钟的高度逼真AI视频的能力,标志着AI视频合成领域的重大进步。

0 人收藏 0 人点赞
#generation

离散扩散模型:从分词到生成的统一框架

arXiv cs.LG · 2026-07-16 缓存

本文介绍了一种离散扩散模型的统一概念框架,通过分词、状态空间构建来分析其设计空间,并强调了训练、推理和扩展中的权衡。

0 人收藏 0 人点赞
#generation

Wan-Dancer: 一种用于分钟级别连贯音乐到舞蹈生成的层次化框架

Reddit r/LocalLLaMA · 2026-07-13

Wan-Dancer 提出了一种层次化框架,用于从音乐生成分钟级别的连贯舞蹈,解决了长时间编舞生成的挑战。

0 人收藏 0 人点赞
#generation

回读:预训练多模态大语言模型作为文本到图像生成的零样本奖励模型

Hugging Face Daily Papers · 2026-07-13 缓存

本文介绍了SpectraReward,一种无需训练的奖励函数,利用预训练的多模态大语言模型(MLLM)作为文本到图像生成中强化学习的零样本奖励模型,在多项指标上持续优于先前方法。

0 人收藏 0 人点赞
#generation

@mattshumer_:GPT-5.6-Sol 一次性生成了这个基于体素的曼哈顿。看看这精度……简直惊人。它运行了将近一周……

X AI KOLs Timeline · 2026-07-09 缓存

GPT-5.6-Sol 在近一周内自主生成了精确的基于体素的曼哈顿。

0 人收藏 0 人点赞
#generation

@Saccc_c: Grok 4.5怎么能这么快,关键质量非常不错 上传了我个人网站的 prd 后,3min 就生成了,整体效果非常的不错

X AI KOLs Following · 2026-07-09 缓存

用户称赞Grok 4.5的速度和质量,上传个人网站PRD后3分钟生成,效果不错。

0 人收藏 0 人点赞
#generation

逐令牌关注多模态生成

Hugging Face Daily Papers · 2026-07-04 缓存

本文研究了多模态大语言模型在生成过程中的令牌级注意力转移,揭示了其中的一致模式,并提出了一种简单的测试时干预方法,显著提升了任务性能。

0 人收藏 0 人点赞
#generation

COMPASS:在统一多模态模型中锚定组合意图引导

arXiv cs.AI · 2026-06-30 缓存

本文提出了COMPASS,首个能够同时锚定组合意图控制,以进行组合感知和组合引导生成的统一多模态框架,并引入了共享专家令牌和Comp-11数据集。

0 人收藏 0 人点赞
#generation

AVTok: 面向整体音视频生成的一维统一标记化

Hugging Face Daily Papers · 2026-06-29 缓存

AVTok提出了一种用于音视频生成的统一一维标记器,采用双流Transformer架构,具有共享编码器-解码器和模态特定查询,实现了紧凑的潜在表示,在重建和下游生成任务中表现出色。

0 人收藏 0 人点赞
#generation

我渴望在我的Strix Halo上获得15倍加速

Reddit r/LocalLLaMA · 2026-06-23

Nvidia声称使用扩散模型在文本生成上实现15倍加速,一次性生成整个文本块。

0 人收藏 0 人点赞
#generation

A2e AI视频与图像

Reddit r/AI_Agents · 2026-06-21

A2e是一款用于视频和图像生成或处理的AI工具。

0 人收藏 0 人点赞
#generation

@SergioPaniego:连续批处理刚刚在TRL的GRPO中实现,在64次生成时,它比普通生成运行更快且使用更少的VRAM…

X AI KOLs Following · 2026-06-19 缓存

连续批处理已添加到TRL的GRPO中,提高了速度并减少了VRAM使用,无需vLLM。推文解释其工作原理及适用时机。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈