标签
Proposes ReCoGen, a two-stage framework for multimodal-conditioned time-series generation under irregular missingness, achieving state-of-the-art downstream utility on physiological benchmarks.
本文介绍了LingT2I,这是一个覆盖10种语言、包含33K个提示词的基准,用于评估文本到图像生成中的跨语言一致性,揭示了内容生成和文本渲染方面的语言不平等及语言依赖的权衡。
RA-CAD 提出了一种用于文本到CAD生成的状态感知智能体,采用生成-执行-批判-重写循环,并通过组相对策略优化进行反馈驱动的智能体优化。它在CADFusion和Text2CAD基准上实现了最先进的执行有效性和几何质量。
TraceCAD是面向基于LLM的CAD智能体的持久化恢复层,用于诊断错误操作并执行局部化、可复用的修复,以提升最终几何质量与修复可靠性。
MotifRole-Diff提出了一种用于分子图上掩码离散扩散的角色感知破坏调度,根据去噪难度和图级扰动影响分配掩码率,在QM9和MOSES基准测试上展示了改进的有效性和降低的FCD。
介绍 ASCIITermDraw Bench,这是一个用于评估视觉语言模型在 ASCII 艺术生成与编辑任务上的基准测试。
介绍了SciForma,一个用于生成具有高结构保真度的科学方法图表的框架,使用多维联合偏好优化(M-DPO)和结构清单来确保在组件、箭头和文本轴上的正确性。该9B模型在基准评估上超越了开源基线和GPT-Image-1.5。
一条推文讨论了Claude Fable 5 Max在克莱因瓶上生成一个宝可梦填字游戏,但表达了怀疑,认为模型可能从训练数据中记住了这个设计。
本文介绍了一种离散扩散模型的统一概念框架,通过分词、状态空间构建来分析其设计空间,并强调了训练、推理和扩展中的权衡。
Wan-Dancer 提出了一种层次化框架,用于从音乐生成分钟级别的连贯舞蹈,解决了长时间编舞生成的挑战。
本文介绍了SpectraReward,一种无需训练的奖励函数,利用预训练的多模态大语言模型(MLLM)作为文本到图像生成中强化学习的零样本奖励模型,在多项指标上持续优于先前方法。
GPT-5.6-Sol 在近一周内自主生成了精确的基于体素的曼哈顿。
用户称赞Grok 4.5的速度和质量,上传个人网站PRD后3分钟生成,效果不错。
本文研究了多模态大语言模型在生成过程中的令牌级注意力转移,揭示了其中的一致模式,并提出了一种简单的测试时干预方法,显著提升了任务性能。
本文提出了COMPASS,首个能够同时锚定组合意图控制,以进行组合感知和组合引导生成的统一多模态框架,并引入了共享专家令牌和Comp-11数据集。
AVTok提出了一种用于音视频生成的统一一维标记器,采用双流Transformer架构,具有共享编码器-解码器和模态特定查询,实现了紧凑的潜在表示,在重建和下游生成任务中表现出色。
连续批处理已添加到TRL的GRPO中,提高了速度并减少了VRAM使用,无需vLLM。推文解释其工作原理及适用时机。