@rohanpaul_ai: 该论文提出利用编码代理自身的内部表示来去除无关的工具输出行,无需...
摘要
该论文提出了SWE-Pruner Pro,它利用编码代理自身的内部表示来剪枝无关的工具输出行,无需单独的剪枝模型即可将令牌使用量减少高达39%。
查看缓存全文
缓存时间: 2026/07/22 08:26
这篇论文提出利用编码智能体自身的内部表征来移除无关的工具输出行,无需单独的剪枝模型。
SWE-Pruner Pro 读取模型最后一层的隐藏状态,并将每行工具输出标记为保留或移除。
编码智能体会反复读取文件、日志和搜索结果,然后将大量未使用的文本带入后续轮次。
SWE-Pruner Pro 添加了一个小型分类器,它读取隐藏状态(即模型的内部摘要),并将每一行标记为保留或剪枝。
一个长度感知信号让模型对短输入更加温和,同时平衡的训练损失保护了稀有但重要的行。
团队仅在 22,609 条标注的工具响应上训练了新增的头部,而编码大模型本身保持不变。
在 2 个开放模型和 4 个多轮基准上,该方法在基本保持质量的同时,最多减少了 39% 的 token 使用量。
在 MiMo-V2-Flash 上,它还使一个编码基准提升了 3.8%,一个长上下文测试提升了 2.2 分。
结果表明,编码智能体已经包含了足够的关联信息,无需单独的剪枝模型即可管理上下文。
– arxiv.org/abs/2607.18213
标题:“SWE-Pruner Pro:编码大模型早已知道该剪枝什么”
相似文章
SWE-Pruner Pro:编程大语言模型早已知道该修剪什么
SWE-Pruner Pro利用编程智能体自身的内部表示来修剪长代码上下文,可节省高达39%的令牌,同时保持或提升多轮基准测试中的任务性能。
@rohanpaul_ai: Meta 论文显示,当编程代理重复使用过去尝试的简短摘要而不是原始日志时,其性能会显著提升……
一篇 Meta 论文显示,编程代理在重复使用过去尝试的简短摘要而非原始日志时性能显著提升,使用 Claude 4.5 Opus 在 SWE-Bench 和 Terminal-Bench 上取得了显著改进。
通过多准则潜在推理的编码代理上下文剪枝
LaMR 提出了一种针对编码代理的结构化剪枝框架,将代码相关性分解为语义证据和依赖支持两个维度,使用专用的条件随机场和混合专家门控机制,在保持或提升任务性能的同时,最多可减少 31% 的 Token 使用量。
@rohanpaul_ai: 精彩新论文来自Meta、CMU及其他实验室。表明编码代理通过制造自己的...来更快地提升。
来自Meta、CMU及其他实验室的一篇新论文提出了Self-play SWE-RL,这是一种方法,编码代理通过在实际代码库中制造和修复错误来训练自己,在SWE-bench基准测试上取得了显著提升,且不依赖人类编写的任务。
@akshay_pachaar: https://x.com/akshay_pachaar/status/2053166970166772052
The article discusses a shift in AI agent tool usage from the 'MCP vs CLI' debate to 'Code Mode,' where agents write code to dynamically import tools, significantly reducing context window usage. It highlights Anthropic's approach and Cloudflare's implementation, demonstrating a 98.7% reduction in token consumption for specific tasks.