标签
介绍了针对LLM激活引导的随机Token引导(STS)和随机块引导(SBS),它们以概率方式按token或按序列控制引导信号。实验表明,仅引导50%的token即可恢复大部分密集引导效果,同时保持流畅性,并且行为结果受累积信号剂量的速率限制。
VaSE是一种无需训练的KV缓存驱逐方法,它保护大数值幅度的值状态,并引入随机性,以提高压缩下推理模型的准确性,超越了现有方法。
Thermocompute 是一个用于热力学概率计算的 PyTorch 仿真器,通过利用并行的热力学底层,使神经网络层能够实现恒定的建模物理时间推理,并立即提供可用于 GPU 的随机层。