@Pavel_Izmailov: 新论文:潜在上下文语言模型(LCLMs)!思想:将16个token编码为1个潜在token,让LLM处理t…
摘要
介绍潜在上下文语言模型(LCLMs),该模型将16个token编码为1个潜在token,以提高性能、速度和内存使用。
新论文:潜在上下文语言模型(LCLMs)!
思想:将16个token编码为1个潜在token,并让LLM在潜在token之上工作。结果:通用模型,在性能/速度/内存使用方面实现了更好的权衡。https://t.co/ldsBOVkmFF
查看缓存全文
缓存时间: 2026/06/10 21:57
新论文:潜在上下文语言模型(LCLMs)!
核心思想:将16个token编码为1个潜在token,LLM在潜在token之上工作。结果:通用模型在性能、速度、内存使用方面均实现更优的平衡。https://t.co/ldsBOVkmFF
相似文章
大规模端到端上下文压缩
本文提出隐上下文语言模型(LCLMs),这是一系列编码器-解码器压缩器,通过架构搜索和大规模预训练高效处理长上下文,在准确性、速度和内存使用上优于传统KV缓存方法。
@samhogan:顺便提一句,RLM 基本已解决上下文问题。你只需将上千万个 token 投入一个成熟的 RLM 框架中,它就能直接跑通……
一位开发者分享了使用 RLM 的实践经验,表示其能够有效承载高达数千万 token 的超长上下文窗口,这标志着上下文处理能力实现了显著跨越。
@ethantsliu: LLMs能够为长上下文自主控制注意力!在文本生成过程中,LLMs通常读取完整的KV缓存……
该论文介绍了声明式注意力技术,LLMs明确声明需要关注哪些上下文段,从而将令牌使用量最多减少52%,同时准确率下降极小。
@LiorOnAI:现在你可以将任何LLM转换成更快的版本,而无需从头重新训练。NVIDIA刚刚在他们30B的模型上实现了这一点。她…
NVIDIA提出了一种方法,将任何LLM转换为更快的版本,方法是将模型拆分为两个副本:一个冻结用于上下文,另一个训练用于并行生成多个token,实现了2.4倍加速,且质量保留约99%,仅使用了8%的训练数据。
大规模下的Hidden Decoding: 大型语言模型的潜在计算扩展
本文介绍了Hidden Decoding,这是一种针对LLM的序列长度扩展方法,通过将每个令牌扩展为多个具有独立嵌入表的流,并在每个令牌内增加内部计算,同时使用Stream-Factorized Attention来保持低成本。在多达617B参数的模型上的实验显示,该方法较基线有一致的改进,展示了一条实用的固定骨干扩展路径。