标签
一篇论文介绍了 TC-LeWM,将 SIGReg 和 VISReg 等正则化损失应用于时间潜在残差,使 LeWM 能够进行多任务学习,显著提高了 LIBERO 机械臂基准上的成功率。
本文介绍了一种基于物理感知自编码器的潜空间框架,用于参数化动力系统的降阶正向建模和变分参数估计,并在计算流体动力学基准上进行了演示。该方法实现了基于可微代理的逆向建模,并在现实噪声或部分观测条件下展现出更好的校准鲁棒性。
介绍了MaSRead,一种用于复制潜在存储的内容寻址读取机制,其中代理共享KV缓存片段,使后续查询能够通过不透明的键控标签集和硬注意力掩码可靠地检索缓存的推理结果。
本文介绍了 Latent Critic,一种轻量级 LoRA 适配器,它通过将 Transformer 的残差流重构为局部自然语言反馈,实时检测幻觉智能体行为,达到 0.966 的 AUROC,并支持自我纠正。
本文提出Dreamer-SAC,一种基于模型的强化学习框架,将递归状态空间世界模型与潜在空间中的软演员-评论家算法相结合,以实现样本高效的自动驾驶。该框架在需要更少的真实环境交互的情况下,优于DreamerV3、SAC和PPO基线。
This paper investigates how molecular generative models internally organize molecular identity in their latent spaces, revealing piecewise-constant regions and coarse-to-fine boundaries across three architectures.
这篇arXiv论文研究了简单的线性变换是否能在九个异构文本嵌入模型之间转换表示,发现共享结构和可迁移性共同取决于架构、训练目标、池化方法和数据分布,对普遍潜在兼容性的观念提出了挑战。
This paper introduces HiLP, a hierarchical representation training method that adds multi-scale self-predictive learning to transformer pretraining, aiming to reduce compounding error and improve long-horizon reasoning and speculative decoding efficiency.
This paper shows that matching a marginal Gaussian prior in factorized generative models does not prevent conditional style leakage, where style latents carry class information. Multiple remedies are explored, but the authors conclude that marginal statistics alone cannot certify class-invariance.
本文介绍了 ODEWorld,一种使用物理时间流(PT-Flow)的连续时间潜在世界模型,该模型学习由常微分方程参数化的潜在速度场,能够实现任意时间分辨率、回溯预测,并改进视频生成和机器人控制的规划。
LatentFlow是一个用于分析分子图神经网络中潜在空间的可视化分析系统,帮助科学家理解分子嵌入聚类如何随层和模型状态演变。
本文探讨了人类语言是一种设计的潜在空间,它将推理约束为模式匹配和符号操作,并论证了LLM无法创造新语言来解决现有语言之外的问题。
Induction Labs 推出了想象模型(imagination models),这是一种新的基础模型架构,从互联网规模的视频中学习。他们的第一个模型 Photon-1 通过观看 18 年的屏幕录像(无动作标签)学习使用计算机,以比 Gemini 3.1 Flash 低 30 倍的预训练成本取得了更好的结果。
MUX 提出了一种无损连续推理的方法,通过将离散推理步骤蒸馏到多路复用的潜在令牌中,这些令牌编码了子词的叠加,实现了更高的带宽,并在语言模型推理任务中支持并行探索。
讨论了一期 Latent Space 播客,其中 Anjney Midha 解释为何拥有无限 GPU 的 AI 实验室仍会失败,并结合他在 amppublic 和 a16z 的经历进行了阐述。
Kevin Kelly认为AI的最大价值在于探索潜空间中的可能性,而非仅仅回答问题,潜空间成为新的创造媒介,强调判断力和跨领域连接的重要性。
本文提出使用单位超球面上的von Mises-Fisher分布混合模型来建模CLIP潜在空间,比高斯假设更好地捕捉其方向性和多模态结构。该模型改善了长尾分布和分布外检测,并提供了CLIP嵌入的语义分解。
SinAE 提出了一个基于普通Transformer的单架构流匹配自编码器,能够在分子、晶体和蛋白质上实现近乎无损的重建,支持跨域训练,并在标准基准测试中展现出强大的生成性能。
本文介绍了VideoRAE,一种表示自编码器,它利用冻结的视频基础模型来创建紧凑、可重建且利于生成的视频潜在表示。该模型在UCF-101上取得了最先进的结果,且收敛速度优于其他自编码器。
Kevin Kelly 认为,AI模型中的潜空间代表所有人类知识的压缩形式,这种潜空间将成为一种新的创造性媒介,使得新颖的艺术和科学探索成为可能。