基于替代似然估计器的可扩展推理时间退火

Hugging Face Daily Papers 论文

摘要

SITA(可扩展推理时间退火)引入了一种方法,通过沿温度阶梯使用基于能量的替代似然重新训练基于流的模型,高效采样分子玻尔兹曼分布,避免了昂贵的散度计算。该方法在丙氨酸二肽和三肽基准测试中达到了最先进的性能。

计算化学和生物物理学中长期存在的挑战是高效地采样分子的玻尔兹曼分布。生成建模的进展已被提出,通过消除模拟的计算成本来应对传统采样技术的局限性。一个有前景的方向是沿着温度阶梯迭代微调扩散模型,其中训练数据通过在推理时间退火期间的重要性采样生成。不幸的是,这些方法需要计算分数场上的散度来估计重要性权重,这使得它们对于较大系统而言难以处理。在这里,我们提出了可扩展推理时间退火(SITA),该方法重新训练基于流的模型,以在逐渐降低的温度下生成样本,并使用基于能量的模型来促进快速的替代似然。我们在丙氨酸二肽和丙氨酸三肽上展示了最先进的性能,同时避免了昂贵的散度项。我们的代码可在 https://github.com/countrsignal/sita.git 获取。
查看原文

相似文章

超越预测:面向尾延迟的LLM推理调度

arXiv cs.LG

本文提出了一种面向LLM推理的分布感知、无预测调度框架,利用轻量级统计信号以软优先级提升替代显式长度预测。该方法联合优化调度与缓存感知的抢占,以降低尾部延迟,相比具备完美长度知识的SRPT,P99 TTLT最多降低35-50%。

拓展热力学AI模型规模

arXiv cs.LG

本文提出了一种基于可扩展反向传播的算法,用于训练在热力学Ising硬件上运行的深度卷积网络,在CIFAR-10上达到94.9%的准确率,在CIFAR-100上达到76.0%的准确率,同时分析了推理成本与准确率之间的权衡。

使用随机梯度马尔可夫链蒙特卡罗的大样本准确不确定性量化

arXiv cs.LG

本文提出了针对带动量和不带动量的随机梯度Langevin动力学(SGLD)的新离散时间近似方法,能够准确预测平稳协方差、迭代平均协方差和积分自相关时间。该方法为大样本不确定性量化提供了改进的调参指导,尤其在模型错误指定情况下。

面向多样化科学假设搜索的大语言模型方法

Hugging Face Daily Papers

本文提出了一种受并行回火启发的进化框架,该框架利用多温度采样和信息交换,提高了大语言模型生成科学假设的多样性和质量,并在分子发现、方程发现和算法发现等领域中得到了验证。