标签
本文研究为何标准神经网络架构在动态规划中无法对更长输入进行泛化,通过利用热带半环理论的几何分析来揭示组合中的结构限制。
本文表明,最先进的视觉-语言模型在视觉推理中的长度泛化任务上因“全局捷径”而失败,并证明将局部中央凹感知与递归相结合能够实现鲁棒的分布外泛化。
新论文介绍了 PoPE,一种将内容与位置解耦的位置编码,解决了在多个 LLM(如 Qwen、Gemma、DeepSeek)中使用的 RoPE 的一个基本缺陷。已在 ICML2026 上展示。
本文系统研究了百万token规模下的上下文检索,介绍了BlockSearch——一个0.6B参数的语言模型检索器,并分析了注意力稀释现象。该模型在MS MARCO和NQ等基准测试上达到或超越了密集检索的性能,并在需要不同相似性概念的任务上显著优于密集检索,突显了上下文检索的潜力,同时强调了在极端上下文增长下注意力控制的重要性。
Wall Attention 将对角遗忘门泛化到 softmax 注意力,实现了从 4k 到 160k+ 上下文的零样本最先进长度外推,并且在预训练中优于 RoPE 和 FoX。它作为即插即用的替换方案发布,附带开源的 Triton 内核。