标签
Augment Code将其编码代理后端切换到Stefano Ermon的Mercury 2.5扩散模型,在生产环境中实现了82%的延迟降低和90%的成本削减。文章强调了扩散模型的性能优势以及独立AI基准测试工具的必要性。
作者创建了 Jevgpt,一个使用小词表和规范解码的自回归聊天机器人,作为个人项目分享在 Hacker News 上。
天王星是一个面向具身智能的新一代仿真基础设施,它采用关节轨迹条件自回归扩散模型,能够以流式展开和可扩展控制的方式,实现可扩展、低延迟的机器人仿真生成。
Reviser是一种新颖的仅解码器Transformer模型,通过自回归光标动作实现可修订的文本生成,与基线模型相比,在保持有竞争力性能的同时,降低了推理计算成本。
本文详细介绍了使用 transformer 为 Super Mario Land 构建一个世界模型,通过标记化输入预测下一个游戏帧,并展示了自回归“梦境生成”来生成未来帧。
Zarya 是一种混合语言模型,联合优化自回归和掩码扩散目标,实现灵活训练和双模推理,已公开发布0.6B、1.7B和4B大小的模型。
Fraglingo引入了一种连接感知的自回归模型,用于分子设计,该模型通过在连续潜空间中联合预测片段身份和连接来生成分子,增强了属性控制和灵活性。
本文使用受控的自回归测试平台,分析了图像分词器设计如何影响多模态模型中的联合文本-图像建模,揭示了不同的扩展行为及其与下游性能的相关性。
Mask Forcing通过在自回归视频扩散蒸馏的自滚动过程中注入掩码清洁信号来缓解模式崩溃,在不需要额外训练数据的情况下提高视觉质量。
DUSt3R 团队的一篇论文提出了用于多视图图像 3D 场景生成的稀疏自回归建模方法,使用了体素对齐的 3D 潜空间与占用感知的掩码自回归 Transformer。
MegaParts 引入了一个可扩展的框架,用于部件感知3D物体生成,该框架使用令牌高效的向量量化令牌和自回归建模,使得能够生成具有多达300个部件的物体。
ChronoSSM 提出了一种自回归状态空间模型,该模型联合建模事件和时间戳,表明联合训练能够提高时间可恢复性,同时不降低内容生成质量。
NVIDIA及其合作者的一项最佳论文研究引入了WorldTrace,这是一个无需训练的框架,通过分配固定的槽位秩位置,使自回归视频世界模型中的压缩记忆保持可寻址,从而实现连贯的长程生成和超越训练视野的长距离回忆。
全带宽Transformer是一种新的Transformer变体,通过门控线性单元反馈顶层隐藏状态,在不改变核心架构的情况下提升推理能力和效率。在多达400B个token上训练后,它能匹配使用1.5倍数据训练的标准Transformer,同时生成更短的推理轨迹。
一位研究者思考这种不稳定的均衡:语言使用自回归模型,而其他模态使用扩散模型,并推测统一的多模态架构取决于每种模态揭示信息的顺序。他为此押下了赌注。
本文研究了一项自监督任务,即使用带有量化VAE分词器的自回归Transformer生成单细胞基因表达向量。文中报告了单细胞基础模型的缩放定律和计算最优前沿,并讨论了针对扰动预测进行微调的潜力。
本文提出了一种多模态自回归Transformer代理模型,用于对地质碳封存中的可变井操作和地质不确定性进行建模,实现了准确的预测,并通过MCMC数据同化实现不确定性量化。
一条推文认为掩码语言建模没有必要,自回归模型就足够了,并顺便提到了 BERT。
JoyAI-Video-Edit 是一个具有 160 亿参数的自回归扩散框架,用于实时、开放式视频编辑,可在单个 NVIDIA B200 GPU 上实现约 30 FPS 的 720p 编辑。