标签
一条推文讨论了Claude Fable 5 Max在克莱因瓶上生成一个宝可梦填字游戏,但表达了怀疑,认为模型可能从训练数据中记住了这个设计。
本文介绍了一种离散扩散模型的统一概念框架,通过分词、状态空间构建来分析其设计空间,并强调了训练、推理和扩展中的权衡。
Wan-Dancer 提出了一种层次化框架,用于从音乐生成分钟级别的连贯舞蹈,解决了长时间编舞生成的挑战。
本文介绍了SpectraReward,一种无需训练的奖励函数,利用预训练的多模态大语言模型(MLLM)作为文本到图像生成中强化学习的零样本奖励模型,在多项指标上持续优于先前方法。
GPT-5.6-Sol 在近一周内自主生成了精确的基于体素的曼哈顿。
用户称赞Grok 4.5的速度和质量,上传个人网站PRD后3分钟生成,效果不错。
本文研究了多模态大语言模型在生成过程中的令牌级注意力转移,揭示了其中的一致模式,并提出了一种简单的测试时干预方法,显著提升了任务性能。
本文提出了COMPASS,首个能够同时锚定组合意图控制,以进行组合感知和组合引导生成的统一多模态框架,并引入了共享专家令牌和Comp-11数据集。
AVTok提出了一种用于音视频生成的统一一维标记器,采用双流Transformer架构,具有共享编码器-解码器和模态特定查询,实现了紧凑的潜在表示,在重建和下游生成任务中表现出色。
连续批处理已添加到TRL的GRPO中,提高了速度并减少了VRAM使用,无需vLLM。推文解释其工作原理及适用时机。
UnityShots 是一个基于记忆的多镜头音视频生成系统,通过固定大小的长期记忆槽和短期记忆槽,结合边界条件门控与离散切类型先验,在视频切换中保持主体外观和音频的一致性。该系统在跨镜头一致性指标上优于开源基线,并达到与闭源系统相当的水平。
UniDDT提出了一种解耦扩散变换器框架,通过利用Noisy ViT编码器和LLM进行语义编码,统一了多模态理解与生成,在两个任务上均取得了强劲性能。
Anthropic 推出了 Claude Fable 5,一个强大的 Mythos 级模型,同时一位开发者分享了一个包含50多个着陆页的仓库,这些页面均由其生成,并保留了提示词供社区使用。
本文提出UniTok,一种将连续时间序列转化为离散标记的通用分词器,以及UniTok-FM,一个基于下一标记预测预训练的基础模型。该模型支持零样本和提示增强预测,以及通过无需训练的上下文推理实现少样本生成和分类——这是以往工作未能实现的能力。
SenseNova U1 是一个统一模型,在同一个架构中处理文本和图像的理解、推理与生成,能够端到端地完成规划信息图等任务。
介绍了六种AI agent工作流形式:分类并执行、扇出并综合、对抗式验证、生成并筛选、锦标赛、循环至完成。