标签
MovieGrid是一种多网格后训练范式,它将长视频分解为空间排列的块,以提高多镜头的连贯性和效率,在视频生成中实现了最先进的镜头内和镜头间一致性。
LiveAnimate 提出了一个14B参数的视频扩散Transformer,通过PR-Sink注意力机制实现了实时、长时、姿态驱动的人体动画,具有稳定流式生成和恒定内存占用。在两个H100 GPU上实现了19.63 FPS的推理速度,在长达三分钟的流中保持质量。
本文提出了一种新颖的在线强化学习方法,通过设计兼顾事实精确性、细节丰富度和回答相关性的奖励函数,来提升推理大语言模型的事实准确性。在六个基准测试上,该方法将幻觉率降低了23.1个百分点。
Marc Andreessen和Joe Rogan进行了超过3小时的对话,本文总结了17个值得关注的观点。
介绍了Magnet——一个基于角色的多智能体目标驱动叙事引擎,用于长篇故事生成,以及Atlas——一个基于图的流水线,用于检测生成叙事中的幻觉。该框架相比单模型基线和IBSEN提高了连贯性并减少了幻觉。
SwanVoice 是一种零样本文本转语音模型,专为富有表现力的长文本独白和对话合成而设计,结合了 VAE、流匹配 DiT 和扩散后训练,在丰富度和层次感得分上均优于现有基线模型。
Swanbench-Speech是一个综合基准评测,用于在多样化场景下评估长篇语音生成,采用涵盖声学、语义和表现力的多维度指标,揭示了当前模型的局限性。
本文构建了一个包含263,911篇长篇小说的大型数据集,这些故事通过基于TTCW的创造力指标进行了标注,并对Qwen3模型进行微调以生成结构化的评论报告。研究发现,非推理微调优于推理监督微调,后者容易出现解析失败和不相关的重复。
YuE是一系列开放基础模型,能够生成具有歌词对齐和结构连贯的长篇音乐,采用创新技术如轨道解耦的下一个令牌预测和结构渐进条件化。