OctoLong:跨仓库代码上下文的中间训练增强长上下文建模
摘要
引入了OctoLong,一个用于整理依赖丰富的跨仓库代码上下文的上下文工程流水线,以及OctoLong-Instruct,一套基于该数据训练的长上下文开放语言模型。实验表明,用OctoLong数据替换12%的传统长上下文语料,在长距离检索、状态跟踪、仓库级代码理解和智能体任务上带来了显著提升。
arXiv:2608.05141v1 公告类型:新
摘要:语言模型(LM)的上下文长度急剧增加,这得益于上下文学习、自我改进和长周期智能体工作流的需求。然而,现有的长上下文语料库主要由书籍、学术文章和代码仓库组成,这些资源有限,且往往缺乏长距离依赖。在这项工作中,我们引入了OctoLong,一个上下文工程流水线,它利用AST解析器、语言服务器后端和包管理器来递归检索代码引用,从而能够整理出长度达数百万token的依赖丰富的代码上下文。然后,我们训练了OctoLong-Instruct,一套能力强大的长上下文开放LM,基于参数规模从6亿到140亿的基础模型,通过上下文扩展中间训练,使用包含约62亿token的OctoLong代码上下文的约500亿token混合语料,随后进行约100亿token的指令微调。我们的训练消融实验和对18个最先进的开放权重长上下文LM的评估表明,用OctoLong数据替换仅12%的传统上下文扩展语料,在长距离检索、长期状态跟踪、仓库级代码理解和下游智能体任务上带来了显著提升,同时增强了短上下文编码场景中的API使用。
查看缓存全文
缓存时间: 2026/08/06 07:43
# OctoLong:跨仓库代码上下文的中间训练增强长上下文建模 来源:https://arxiv.org/abs/2608.05141 查看 PDF(https://arxiv.org/pdf/2608.05141) > 摘要:语言模型(LM)的上下文长度急剧增加,这得益于对上下文学习、自我改进和长周期智能体工作流的需求。然而,现有的长上下文语料库主要由书籍、学术论文和代码仓库构成,这些资源有限,且往往缺乏长距离依赖关系。在这项工作中,我们介绍了 OctoLong,这是一个上下文工程流水线,它使用 AST 解析器、语言服务器后端和包管理器来促进代码引用的递归检索,从而能够整理长度达数百万 token 的富含依赖关系的代码上下文。随后,我们在包含约 62 亿 token OctoLong 代码上下文的约 500 亿 token 混合语料上进行上下文扩展中间训练,并辅以约 100 亿 token 的指令微调,训练出了 OctoLong-Instruct,这是一系列能力强大的长上下文开放语言模型,源自参数规模从 6 亿到 140 亿不等的基座模型。我们的训练消融实验和针对 18 个最先进开放权重长上下文语言模型的实验评估表明,仅用 OctoLong 数据替代 12% 的传统上下文扩展语料,就能在长距离检索、长期状态跟踪、仓库级代码理解和下游智能体任务上带来显著提升,同时还能增强短上下文编码场景中的 API 使用能力。 ## 提交历史 来自:Indraneil Paul 先生 [查看电子邮件(https://arxiv.org/show-email/2d28635f/2608.05141)] **[v1]** 2026年8月5日星期三 17:58:15 UTC(640 KB)
相似文章
LongAttnComp: 面向长上下文推理的跨家族上下文压缩
LongAttnComp 通过微调轻量级交叉注意力层并引入 token 级分块、top-p 算法、位置重排序和查询解析器,将 AttnComp 适配到长上下文推理。它在代码调试等长上下文任务上取得了强劲性能,并能跨多个模型家族迁移。
Jet-Long: 具有动态双焦RoPE的高效长上下文扩展
Jet-Long提出了一种无需微调的零样本方法,通过动态调整RoPE缩放来扩展LLM上下文长度,在高达128K上下文的基准测试中取得了强劲性能,且推理开销极小。
Jet-Long: 高效长上下文扩展与动态双焦点RoPE
介绍了Jet-Long,一种用于长上下文扩展的零样本方法,该方法动态调整重缩放因子并使用双焦点注意力机制,无需重新训练即可在不同序列长度上实现高效高性能处理。
更少上下文,更智能代理:面向长周期工具使用的LLM代理的高效上下文工程
本文评估了企业工具使用工作流中LLM代理的上下文工程配置,表明选择性修剪的摘要化相比全上下文基线实现了91.6%的准确率,同时将令牌使用量减少了60%以上。
GoLongRL:面向能力的长上下文强化学习与多任务对齐
GoLongRL 提出了一种开源方法,通过面向能力的数据构建和 TMN-Reweight 方法,实现具有多样化奖励优化的长上下文强化学习。