标签
本文介绍了 Adaptive-Scalable Entmax (ASEntmax),一种可学习的稀疏注意力机制,在transformers中实现高达1000倍的长度外推,提升长上下文泛化能力的同时保持短上下文性能。
本文提出了FreqDiff,一种用于时序知识图谱外推的频率感知扩散框架,该框架改进了不确定性建模,并在基准测试中取得了最先进的性能。
Introduces Latent Dynamics Reasoning (LDR), a video world model that integrates kinematic dynamics in a structured latent space, enabling extrapolation of learned dynamics far beyond training distributions while using far fewer parameters and running much faster than video diffusion baselines.
本文介绍了Skaling定律,这是一种广义的神经缩放定律,通过一个交互指数将模型容量和数据耦合,将预测误差降低1.5至3倍,并能在计算量约为均匀扫描十分之一的情况下实现全网格外推。
本文介绍了层次化领域泛化,将有限观测区域外推至整个实例空间的形式化。结果表明,无论假设类多么简单,某些领域划分都会使泛化无法实现,并认为现代泛化理论必须将领域结构作为首要因素纳入考量。
本文研究了具有斐波那契间距偏移和逐层缩放因子的稀疏自注意力,发现静态逐层调度优于学习型或固定型调度,且稀疏变体在训练长度4倍时仍能稳健外推,而密集注意力则崩溃。
本文认为,当目标分布处于分布外时,基础条件扩散模型在组合生成方面根本失败,原因是分数估计误差,并且推理时的校正无法完全补偿。
本文介绍了概念调制模型(CMMs),一个用于条件生成模型可识别性和外推的统一框架。它表明,已观测属性上的特征一致性通过属性势产生约束,从而使得代数外推准则能够恢复并泛化现有结果。
DecMem 提出了一种解耦记忆架构,结合稀疏全局记忆和锚定局部记忆,实现了分钟级一致视频生成,性能优于现有最优方法。
傅里叶神经算子(FNOs)在建模周期性驱动的量子系统时取得了外推成功,通过在频率空间中捕捉时间相关性,实现了超越训练数据的物理忠实动力学。