OctoLong:跨仓库代码上下文的中间训练增强长上下文建模

arXiv cs.AI 论文

摘要

引入了OctoLong,一个用于整理依赖丰富的跨仓库代码上下文的上下文工程流水线,以及OctoLong-Instruct,一套基于该数据训练的长上下文开放语言模型。实验表明,用OctoLong数据替换12%的传统长上下文语料,在长距离检索、状态跟踪、仓库级代码理解和智能体任务上带来了显著提升。

arXiv:2608.05141v1 公告类型:新 摘要:语言模型(LM)的上下文长度急剧增加,这得益于上下文学习、自我改进和长周期智能体工作流的需求。然而,现有的长上下文语料库主要由书籍、学术文章和代码仓库组成,这些资源有限,且往往缺乏长距离依赖。在这项工作中,我们引入了OctoLong,一个上下文工程流水线,它利用AST解析器、语言服务器后端和包管理器来递归检索代码引用,从而能够整理出长度达数百万token的依赖丰富的代码上下文。然后,我们训练了OctoLong-Instruct,一套能力强大的长上下文开放LM,基于参数规模从6亿到140亿的基础模型,通过上下文扩展中间训练,使用包含约62亿token的OctoLong代码上下文的约500亿token混合语料,随后进行约100亿token的指令微调。我们的训练消融实验和对18个最先进的开放权重长上下文LM的评估表明,用OctoLong数据替换仅12%的传统上下文扩展语料,在长距离检索、长期状态跟踪、仓库级代码理解和下游智能体任务上带来了显著提升,同时增强了短上下文编码场景中的API使用。
查看原文
查看缓存全文

缓存时间: 2026/08/06 07:43

# OctoLong:跨仓库代码上下文的中间训练增强长上下文建模
来源:https://arxiv.org/abs/2608.05141
查看 PDF(https://arxiv.org/pdf/2608.05141)

> 摘要:语言模型(LM)的上下文长度急剧增加,这得益于对上下文学习、自我改进和长周期智能体工作流的需求。然而,现有的长上下文语料库主要由书籍、学术论文和代码仓库构成,这些资源有限,且往往缺乏长距离依赖关系。在这项工作中,我们介绍了 OctoLong,这是一个上下文工程流水线,它使用 AST 解析器、语言服务器后端和包管理器来促进代码引用的递归检索,从而能够整理长度达数百万 token 的富含依赖关系的代码上下文。随后,我们在包含约 62 亿 token OctoLong 代码上下文的约 500 亿 token 混合语料上进行上下文扩展中间训练,并辅以约 100 亿 token 的指令微调,训练出了 OctoLong-Instruct,这是一系列能力强大的长上下文开放语言模型,源自参数规模从 6 亿到 140 亿不等的基座模型。我们的训练消融实验和针对 18 个最先进开放权重长上下文语言模型的实验评估表明,仅用 OctoLong 数据替代 12% 的传统上下文扩展语料,就能在长距离检索、长期状态跟踪、仓库级代码理解和下游智能体任务上带来显著提升,同时还能增强短上下文编码场景中的 API 使用能力。

## 提交历史

来自:Indraneil Paul 先生 [查看电子邮件(https://arxiv.org/show-email/2d28635f/2608.05141)] **[v1]** 2026年8月5日星期三 17:58:15 UTC(640 KB)

相似文章

LongAttnComp: 面向长上下文推理的跨家族上下文压缩

Hugging Face Daily Papers

LongAttnComp 通过微调轻量级交叉注意力层并引入 token 级分块、top-p 算法、位置重排序和查询解析器,将 AttnComp 适配到长上下文推理。它在代码调试等长上下文任务上取得了强劲性能,并能跨多个模型家族迁移。

Jet-Long: 高效长上下文扩展与动态双焦点RoPE

Hugging Face Daily Papers

介绍了Jet-Long,一种用于长上下文扩展的零样本方法,该方法动态调整重缩放因子并使用双焦点注意力机制,无需重新训练即可在不同序列长度上实现高效高性能处理。