length-generalization

标签

Cards List
#length-generalization

动态规划的表示几何

arXiv cs.LG · 2天前 缓存

本文研究为何标准神经网络架构在动态规划中无法对更长输入进行泛化,通过利用热带半环理论的几何分析来揭示组合中的结构限制。

0 人收藏 0 人点赞
#length-generalization

论视觉推理中的局部性与长度泛化

Hugging Face Daily Papers · 2026-07-10 缓存

本文表明,最先进的视觉-语言模型在视觉推理中的长度泛化任务上因“全局捷径”而失败,并证明将局部中央凹感知与递归相结合能够实现鲁棒的分布外泛化。

0 人收藏 0 人点赞
#length-generalization

@agopal42:今天在 #ICML2026 上介绍 PoPE!我们从内容-位置纠缠的角度重新审视 RoPE,并展示如何用极坐标…

X AI KOLs Timeline · 2026-07-06 缓存

新论文介绍了 PoPE,一种将内容与位置解耦的位置编码,解决了在多个 LLM(如 Qwen、Gemma、DeepSeek)中使用的 RoPE 的一个基本缺陷。已在 ICML2026 上展示。

0 人收藏 0 人点赞
#length-generalization

语言模型真的能进行上下文检索吗?在百万token规模的文档中挣扎

arXiv cs.CL · 2026-07-03 缓存

本文系统研究了百万token规模下的上下文检索,介绍了BlockSearch——一个0.6B参数的语言模型检索器,并分析了注意力稀释现象。该模型在MS MARCO和NQ等基准测试上达到或超越了密集检索的性能,并在需要不同相似性概念的任务上显著优于密集检索,突显了上下文检索的潜力,同时强调了在极端上下文增长下注意力控制的重要性。

0 人收藏 0 人点赞
#length-generalization

@tilderesearch: https://x.com/tilderesearch/status/2061771450168889432

X AI KOLs Timeline · 2026-06-02 缓存

Wall Attention 将对角遗忘门泛化到 softmax 注意力,实现了从 4k 到 160k+ 上下文的零样本最先进长度外推,并且在预训练中优于 RoPE 和 FoX。它作为即插即用的替换方案发布,附带开源的 Triton 内核。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈