标签
BLARM是一种前馈方法,通过混合潜在刚性运动基元从单目视频动画化3D网格,实现无需显式骨架的时序连贯动画。
本文提出意图蒸馏 (INDI),将行为意图蒸馏到视觉-语言-动作模型的动作解码器中,从而在SimplerEnv-Bridge等基准测试和现实世界任务中提高了性能。
本文介绍了“千字节模型”,一种极端压缩范式,其中神经网络权重从种子和量化潜向量重新生成,利用映射网络和分块种子基将存储减少到千字节级别。
AURORA-LM 提出了一种连续潜空间扩散语言模型,将可解码的文本表示与分布建模分离,在 OpenWebText 和 XSum 上取得了强劲性能,并扩展到 1B 参数规模。
MUGEN 提出了一个统一的运动-语言框架,避免了离散码本和迭代解码,使用带有连续潜变量槽位的单一自适应长度自编码器以及一次性生成,在 HumanML3D 和 SnapMoGen 基准上实现了高效、高质量的文本到运动与运动到文本性能。
LATO.2是一个用于三维网格生成的分解式流匹配框架,它将生成过程分解为顶点流和基于顶点的连接流,实现了最先进的几何保真度和连接质量。
识别了VAEs中后验坍塌的两个耦合原因,并引入了λ-VAE,这是一种对重新参数化步骤的修改,通过均衡各潜变量维度的方差来减少坍塌并提高信息容量。
AdaJEPA引入了一种自适应的潜在世界模型,该模型在测试期间通过闭环模型预测控制持续更新,显著提高了分布偏移下的规划成功率。
本文证明,扩散语言模型(DLM)在其残差流中内部将去噪进度表示为潜在时间步信号,可通过探针检测并引导来调节模型的置信度和熵。
BAAI 发布了 Orca 论文,描述了一种多模态潜在世界模型,该模型首先学习统一的世界表示,然后使用冻结的主干网络和微小的解码器解码为文本、图像或动作,权重即将发布。
本文引入了大型语言模型中行为安全与表征层面鲁棒性之间的审计差距概念,提出了基于干预的评估框架和Latent Vulnerability Score(LVS)来衡量隐藏的脆弱性。
介绍了Thoughts-as-Planning框架,该框架使用潜在世界模型和强化学习将思维链优化建模为序列决策过程,在效率和泛化方面优于现有方法。
Latte 提出了一种框架,将个性化表示为通过潜在轨迹预测同侪锚定的相对偏好状态,并向冻结的LLM注入一个软令牌以实现个性化生成。在Amazon Reviews 2023和MemoryCD数据集上,它优于现有的个性化方法。
ATLAS提出了一种视觉推理框架,该框架通过功能标记将智能体操作和隐式表示相结合,实现了通过下一个标记预测和强化学习进行高效训练,同时避免了中间图像的生成。
本文为非参数化框架下从通用模型中提取任务相关表示建立了可辨识性保证,证明在稀疏正则化条件下,任务结构在不同时间步之间是可辨识的,且潜在表示在每个时间步内也是可辨识的。