token-reduction

标签

Cards List
#token-reduction

构建了颜色频率压缩协议(MusCoRe),将24轮代理历史记录的令牌数量削减了71.9%——规格化一个边缘推理基准测试,以检验其是否能消除3B–7B模型对GPU的依赖

Reddit r/AI_Agents · 2026-08-15

本文介绍MusCoRe,一种颜色频率压缩协议,可将AI代理对话的令牌使用量减少71.9%,实现在无GPU依赖的低资源设备上进行潜在本地推理。

0 人收藏 0 人点赞
#token-reduction

@_guillecasaus: 他们刚刚解决了 Claude Code 的最大问题之一。他们创建了 Graft,一个防止代理重复读取项目的工具。

X AI KOLs Timeline · 2026-08-15 缓存

Graft 是一个免费且开源的工具,可以防止 Claude Code 的代理在每个任务中重新读取项目,大幅减少 token 消耗和时间,并且完全在本地运行。

0 人收藏 0 人点赞
#token-reduction

BLADE:面向高效LLM推理的边界扩展与层自适应动态退出

arXiv cs.CL · 2026-08-03 缓存

BLADE是一个轻量级框架,通过将探测检查点扩展到句子边界、自我怀疑边界和段落边界,并自适应地选择信息量大的隐藏层,来动态终止LLM推理。在Qwen3模型上的实验表明,BLADE在保持接近基线的准确率的同时,在Qwen3-8B上减少了24.8%的词元,在Qwen3-4B上减少了15.8%。

0 人收藏 0 人点赞
#token-reduction

Webfetch - 面向LLM智能体的本地网页搜索,减少87%令牌使用量并降低66%成本

Reddit r/AI_Agents · 2026-07-22

Webfetch是一款工具,可为LLM智能体提供本地网页搜索,将令牌使用量减少87%,成本降低66%,提升效率。

0 人收藏 0 人点赞
#token-reduction

Token减少并非成本降低

arXiv cs.CL · 2026-07-15 缓存

本文通过实证评估,研究API-based coding agents中减少token是否能降低实际计费成本。结果表明,prompt-cache流量主导了成本构成,减少token并不能可靠地降低成本,还可能损害任务完成率。

0 人收藏 0 人点赞
#token-reduction

@AstroHanRay: 我们针对工具裁剪(active tool prune)实际跑了 A/B benchmark 测试,121 组 Terminal Bench 任务对比: - 性能:无回退(甚至略有提升 +2.48pp) - Token 消耗:减少 41.7…

X AI KOLs Following · 2026-06-28 缓存

针对Agent工具裁剪(active tool prune)的A/B测试显示:在121组Terminal Bench任务中性能略有提升(+2.48个百分点),Token消耗减少41.7%,成本降低31.6%。

0 人收藏 0 人点赞
#token-reduction

@mattpocockuk: “X技术可减少Y% token”这种潮流已经过时了,真不敢相信还有人会上当。

X AI KOLs Following · 2026-06-21 缓存

一条推文批评了token缩减的潮流,同时重点介绍了Headroom,这是Netflix工程师开发的开源工具,可在本地压缩LLM载荷,降低成本高达95%。

0 人收藏 0 人点赞
#token-reduction

Conduit

Product Hunt · 2026-06-20

Conduit 是一个本地 MCP 网关,可将令牌使用量减少大约 90%,帮助降低 AI 应用的成本。

0 人收藏 0 人点赞
#token-reduction

@DataChaz: 最高减少95%的令牌消耗,无需修改代码 一位Netflix工程师刚刚开源了Headroom,这是……

X AI KOLs Timeline · 2026-06-19 缓存

Headroom是来自Netflix工程师的开源工具,它在本地代理中封装Cursor或Claude以压缩有效负载,无需修改代码即可将令牌使用量减少高达95%,同时保持逻辑准确性。

0 人收藏 0 人点赞
#token-reduction

@geekbb: 为 Pi coding agent 提供纯算法化的会话压缩,无需 LLM 调用

X AI KOLs Timeline · 2026-06-18 缓存

pi-vcc 是一个开源工具,为 Pi coding agent 提供纯算法化的会话压缩,无需 LLM 调用即可实现 35-99% 的令牌缩减,并通过 vcc_recall 支持无损历史搜索。

0 人收藏 0 人点赞
#token-reduction

Reroute,而非移除:面向视觉语言模型的可恢复视觉令牌路由

Hugging Face Daily Papers · 2026-06-10 缓存

提出Reroute,一种无需训练的视觉语言模型插件,用可恢复的路由替代不可逆的视觉令牌剪枝,允许令牌在后续阶段重新进入流水线,从而在激进的令牌缩减下提升接地性能,同时保持VQA性能。

0 人收藏 0 人点赞
#token-reduction

可微分高效算子搜索

arXiv cs.LG · 2026-06-05 缓存

介绍了高效算子搜索(EOS),这是一个统一的可微分框架,将令牌缩减方法(剪枝、合并、池化、自适应重加权)泛化到共享算子空间,在预算约束下自动搜索最优算子组合。该方法在多个基准上取得有竞争力的结果,并揭示了一致的算子模式。

0 人收藏 0 人点赞
#token-reduction

我构建了一个将Python重写为面向模型表示的编译器

Reddit r/LocalLLaMA · 2026-06-03 缓存

Vulpine是一个编译器,它将人类可读的Python代码转换为针对LLM优化的压缩宏表示,平均减少13.8%的token数,同时支持精确的结构重建。

0 人收藏 0 人点赞
#token-reduction

AQuaUI:基于自适应四叉树的GUI代理视觉令牌减少方法

arXiv cs.AI · 2026-05-20 缓存

AQuaUI是一种无需训练、推理时即用的GUI代理模型令牌减少方法,利用自适应四叉树降低截图中的空间冗余,实现了高达13.22%的加速和29.52%的视觉令牌减少,同时保留了99.06%的性能。

0 人收藏 0 人点赞
#token-reduction

当推理收敛时停止:保留语义的推理模型提前退出

Hugging Face Daily Papers · 2026-05-17 缓存

本文介绍 PUMA,一个即插即用框架,通过检测思维链推理中的语义冗余实现提前退出,在多个模型和基准测试中平均减少 26.2% 的 Token,同时保持准确性和推理质量。

0 人收藏 0 人点赞
#token-reduction

立即就绪:LOOP技能引擎通过一次性记录和确定性回放实现99%成功率并削减99%代币用量

arXiv cs.AI · 2026-05-15 缓存

LOOP技能引擎通过记录单次LLM驱动的执行,并通过参数化无分支技能进行确定性回放,实现了周期性AI代理任务99%的成功率和99%的代币削减,消除了随机性失效和高昂成本。

0 人收藏 0 人点赞
#token-reduction

@berryxia: Agent 记忆真是太特么卷了啊! 不得不说,这个赛道越多人加入越爽啊! Tencent AI团队花了整整6个月,就死磕一个问题:AI agent长会话里疯狂丢上下文。 他们最后把一套记忆系统做完,直接开源了。 我看完他们的分享,最大的感…

X AI KOLs Timeline · 2026-05-14 缓存

腾讯AI团队开源了Agent记忆系统,通过实时上下文压缩、Mermaid任务地图和Persona记忆三种方法,显著提升长对话中的token效率和agent一致性,token消耗降低61%,人格一致性从48%提升至76%。

0 人收藏 0 人点赞
#token-reduction

提示微调:数据越少,推理能力越强

arXiv cs.CL · 2026-05-12 缓存

本文提出了一种名为“提示微调”(Hint Tuning)的数据高效方法,该方法根据问题难度校准推理深度,从而减少推理模型中的标记使用量。在仅需1K个自标注样本的情况下,该方法在 Qwen3-Thinking 和 DeepSeek-R1-Distill 等模型上实现了显著的标记减少(24%-66%)。

0 人收藏 0 人点赞
#token-reduction

学习自适应推理路径以实现高效视觉推理

Hugging Face Daily Papers · 2026-04-16 缓存

AVR是一种自适应视觉推理框架,能够动态选择最优推理格式,在视觉推理任务中减少50-90%的token使用量同时保持准确性。该方法通过将视觉推理分解为三种认知功能并使用FS-GRPO训练来鼓励高效格式选择,从而解决推理路径冗余问题。

0 人收藏 0 人点赞
#token-reduction

rtk-ai/rtk

GitHub Trending (daily) · 2026-05-19 缓存

RTK 是一个高性能的 CLI 代理,可在命令输出到达 LLM 上下文之前对其进行过滤和压缩,从而将 token 消耗减少 60-90%,且开销极低。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈