如果思维链不是有损的会怎样?探索用于边缘LLM的可逆逻辑(Toffoli/Fredkin风格)

Reddit r/LocalLLaMA 论文

摘要

本文探讨了使用受Toffoli和Fredkin门启发的可逆逻辑,使LLM中的思维链推理近似可逆,旨在减少错误、内存使用,并为边缘设备实现高效的逆计算。

目前标准的思维链是单向的。你向前生成,将一堆草稿板令牌转储到KV缓存中,并祈祷模型不会中途产生幻觉。在手机/笔记本电脑上,这会导致两个棘手的问题:错误累积。如果每一步只有 (1-ε) 的可靠性,N步链会以 ~e^{-Nε} 的速度失效。没有廉价的方法在不进行另一次完整前向传递的情况下检查中间步骤。KV缓存只是不断增长。中间令牌永远留在那里。盲目剪枝会破坏上下文,因此内存与推理长度成 O(N) 关系。想法:如果每个推理步骤都是嵌入空间中的近似可逆变换——基本上是经典可逆门(Toffoli、Fredkin)的软模拟呢?如果步骤是双射的(或足够接近):• 通过循环一致性进行即时健全性检查:运行 f⁻¹(f(X)),看看是否能恢复 X。大的偏差 → 该步骤泄漏了信息/产生了幻觉。无需额外的评判模型• Bennett风格的逆计算:一旦达到答案,你可以系统地“逆计算”中间草稿板令牌并释放KV插槽。理论上,这可以将活动工作内存从 O(N) 降至约 O(log N)(经典的可逆计算结果)。• 廉价的回溯:遇到死胡同?就地应用逆操作,而不是清除整个缓存或重新编码父状态。我将其视为我们实际本地运行的模型的轻量级推理工具/外部草稿板,而不是试图让标准的密集注意力层反向运行。softmax 和常见的投影矩阵是有损的;可逆性将存在于结构化的潜在寄存器、可逆耦合层或位于冻结模型之上的RevNet风格适配器中。在低秩适配器上的逆向传递仍然是前向传递,但它比启动第二个大型评判模型或多路径拒绝采样便宜几个数量级。开放问题 / 健全性检查需求 • 是否有人已经尝试过专门为中间思维链令牌使用可逆投影层或可逆残差块?• 如何处理不可逆的注意力头?(例如,使用轻量级可逆耦合层/RevNets作为外部推理草稿板层 vs. 尝试修改原生权重)• 你更愿意先看到这是一个结构化解码工具(Outlines/Guidance风格的保持可逆的寄存器),还是一个小的微调来教模型循环一致的引理步骤?• 在真实的transformers/真实的KV缓存中,是否有明显的原因使这注定失败?
查看原文

相似文章

大语言模型何时进行推理?基于熵相变的动力系统视角

arXiv cs.LG

本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。

并非所有LLM推理都可见于思维链

arXiv cs.CL

本文证明,前沿语言模型能够利用语义无关的填充令牌进行“不可见推理”,在合成推理任务上准确率提升高达13个百分点,这动摇了思维链监控能捕获所有推理的假设。