标签
BrainJanus是首个统一的大脑模型,通过共享的Omni空间整合大脑、视觉与语言,利用分词表征和自回归下一个token预测实现神经活动与感官刺激的双向映射。
本文提出了Nemotron-TwoTower,一种扩散语言模型,通过冻结的自回归塔和可训练的扩散去噪器解耦上下文表示与去噪过程,以2.42倍吞吐量达到了基线质量98.7%的水平。
Parallel Rollout Approximation (PRA) 通过使用低维中间状态和并行训练改进了像素空间自回归图像生成,在ImageNet-1K生成任务上取得了新的最先进结果。
本文研究了在数据受限、算力充足的场景下,为缓解自回归语言模型预训练中的过拟合而采用训练时数据增强技术,发现结合词元级噪声、序列排列和目标偏移预测可以改善验证损失。
本文提出E³RL,一种使用动态认知熵阈值的强化学习方法,使LLMs能够在生成过程中切除局部逻辑缺陷,克服长程推理中的自回归诅咒,并在AIME等数学推理基准上取得最先进的结果。
本文提出了一种离散自回归Transformer,能够从目标连杆曲线生成平面机构,利用变分自编码器潜变量和标记化的关节坐标,在多种拓扑结构上实现多样且精确的设计。
MaineCoon是一个220亿参数的实时视听自回归模型,用于社交世界建模,能够在单个GPU上以高达47.5 FPS进行流式生成,并引入了新颖的训练技术和智能体推理框架。
UniAR提出了一个统一的自回归框架,使用单个离散视觉分词器桥接视觉理解与生成,在图像生成和编辑方面取得了最佳成果。
LOGOS是一个科学生成语言模型,它将多种科学对象及其空间交互编码为令牌序列,从而在自然科学的各类任务中实现统一的自主回归框架。1B、3B和8B参数的模型展现出性能随规模一致提升,并已发布以促进研究。
FadeMem 引入了一种距离感知的键值记忆整合机制,将历史视频数据组织成时间层次结构,在固定缓存约束下改进长视频生成。
本文研究数据受限的语言模型预训练,提出了掩码输入正则化(MIR)以改进验证损失和下游性能,以及SoftQ,一种更好地捕捉重复数据下模型与数据交互的缩放定律。
Stream3D-VLM 是一款在线3D视觉-语言模型,通过增量整合几何先验并使用几何自适应体素压缩,能够从流式视频中实现实时空间理解,在3D空间理解任务上优于现有模型。
StreamForce 是一种因果统一视频生成模型,通过蒸馏流水线和自回归架构,为时变力提供实时、基于物理的响应,在力的遵循度和运动真实性方面达到了最先进的性能。
dots.tts 提出了一个拥有 2B 参数的连续自回归文本转语音 (TTS) 模型,基于多语言数据进行训练,在 Seed-TTS-Eval 等基准测试上取得了最先进的性能,并通过 CFG-aware MeanFlow 蒸馏实现了低延迟流式生成。该模型、代码和检查点均以 Apache 2.0 许可证发布。
Echo-Infinity 提出了一种可学习的演化记忆机制,用于自回归视频生成,以恒定的内存成本实现了实时无限视频生成,并达到了最先进的性能。
MeshWeaver 提出了一种自回归网格生成框架,它使用多级稀疏体素编码器直接预测顶点,为高多边形网格实现了最先进的压缩率和几何保真度。
NEPA 是一种新的视觉自监督学习和生成式预训练方法,它通过自回归方式预测下一个嵌入,并已添加至一个基准测试中用于评估。
Steady-Forcing 提出了一种记忆与训练框架,旨在长时域自然视频生成中平衡空间稳定性与运动连续性,在保持流体动态持续多分钟滚动生成的同时,提升背景一致性。
AAD-1 引入具有分阶段训练的非对称对抗性蒸馏,以实现一步自回归视频生成,在 VBench 上优于先前方法。
作者介绍了一个小型基于Transformer的神经网络,从零开始训练,能够将任意图像转化为可玩游戏,在RTX 5090等消费级GPU上实时运行。该模型使用自回归解码和KV缓存,但目前存在运动和上下文问题。