SWE-Pruner Pro:编程大语言模型早已知道该修剪什么

Hugging Face Daily Papers 论文

摘要

SWE-Pruner Pro利用编程智能体自身的内部表示来修剪长代码上下文,可节省高达39%的令牌,同时保持或提升多轮基准测试中的任务性能。

对于编程智能体而言,修剪长上下文是一项至关重要的高效上下文管理技术。现有诸如SWE-Pruner等上下文修剪方法通过附加一个独立的代码分类器来实现,但我们发现智能体本身在读取工具输出时,其内部表示已编码了代码上下文的相关性信息。基于这一发现,我们提出了SWE-Pruner Pro,它直接在智能体内部修剪工具输出。具体而言,一个小型头部将智能体自身的内部表示转换为每行的保留或修剪标签,并结合一个长度感知的嵌入(以每个工具输出的行数为键)。在两个开放权重基座模型和四个多轮基准测试中,SWE-Pruner Pro可节省高达39%的提示和完成令牌,同时保持任务质量,且推理开销有限。值得注意的是,在MiMo-V2-Flash上,SWE-Pruner Pro还将SWE-Bench Verified的解决率提升了+3.8%,长上下文Oolong准确率提升了+2.2个百分点。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:35

论文页面 - SWE-Pruner Pro:编码器LLM已经知道要修剪什么

来源: https://huggingface.co/papers/2607.18213

摘要

针对编码智能体的长上下文修剪(Pruning long context)已成为高效上下文管理的关键技术。虽然现有的上下文修剪方法(如SWE-Pruner)通过附加独立的代码分类器实现这一功能,但我们发现,智能体本身在读取工具输出时,其内部表示已经编码了指示代码上下文相关性的信息。基于这一发现,我们提出了SWE-Pruner Pro,它直接在智能体内部修剪工具输出。具体来说,一个小型头部将智能体自身的内部表示转换为每行的“保留或修剪“标签,并利用一个长度感知嵌入(与每个工具输出的行数相关联)。在两个开源骨干模型和四个多轮基准测试中,SWE-Pruner Pro在保持任务质量的同时,最多节省了39%的提示和补全令牌,且推理开销可控。值得注意的是,在MiMo-V2-Flash上,SWE-Pruner Pro还将SWE-Bench Verified解决率额外提升了+3.8%,长上下文Oolong准确率提升了+2.2个百分点。

查看arXiv页面 (https://arxiv.org/abs/2607.18213) 查看PDF (https://arxiv.org/pdf/2607.18213) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.18213)

在你的智能体中获取这篇论文:

hf papers read 2607\.18213

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2607.18213,即可从本页链接到该模型。

引用该论文的数据集0

没有数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2607.18213,即可从本页链接到该数据集。

引用该论文的Spaces0

没有Space链接此论文

在Space README.md中引用arxiv.org/abs/2607.18213,即可从本页链接到该Space。

包含该论文的收藏0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 中,即可从本页链接到该收藏。

相似文章

通过多准则潜在推理的编码代理上下文剪枝

arXiv cs.AI

LaMR 提出了一种针对编码代理的结构化剪枝框架,将代码相关性分解为语义证据和依赖支持两个维度,使用专用的条件随机场和混合专家门控机制,在保持或提升任务性能的同时,最多可减少 31% 的 Token 使用量。

及时止损!学习早期剪枝路径以实现高效并行推理

Hugging Face Daily Papers

本文介绍了STOP(用于剪枝的超令牌),一种轻量级方法,通过在并行解码中附加可学习令牌并读取KV缓存状态,学会早期剪枝不优的推理路径,在AIME和GPQA基准测试中实现70%的令牌减少,同时提高性能。