tool-prune:在0.4毫秒内将50多个工具Schema精简至候选(-92%提示令牌,零依赖)

Reddit r/LocalLLaMA 工具

摘要

tool-prune是一个工具,用于在调用本地LLM模型前精简工具Schema,减少92%的提示令牌并避免幻觉,无需额外LLM轮询。

当运行带有工具的本地7B/8B模型时,上下文中的50多个Schema会降低注意力并导致干扰幻觉。使用带内渐进式搜索(tool_search)需要额外的完整LLM生成回合(+2秒),且小型模型经常忘记调用搜索工具或陷入发现循环。tool-prune在模型调用前在客户端进行预处理:const topTools = await router.filter(userPrompt); 0额外LLM轮询 通过FWHT离线处理0.4毫秒(纯JS和Python,使用SIMD时23微秒) -92%提示令牌 用于确定性查询的直接分发选项,在1毫秒内完成 零外部依赖 演示平台:https://hemanth.github.io/tool-prune/ GitHub:https://github.com/hemanth/tool-prune
查看原文

相似文章

通过令牌剪枝优化韩语中心的大语言模型

arXiv cs.CL

本文系统地评估了令牌剪枝这一压缩技术在韩语中心的LLM任务上的应用,该技术通过移除与无关语言对应的令牌和嵌入参数来压缩模型。研究评估了流行的多语言模型(Qwen3、Gemma-3、Llama-3、Aya)在不同词汇配置下的表现,发现令牌剪枝能显著改进生成稳定性并降低特定领域部署的内存占用。

一种用于视觉令牌剪枝的AI4AI框架

Hugging Face Daily Papers

AutoPrune是一个无需训练的框架,利用大语言模型(LLMs)通过领域特定语言和残差搜索自动为多模态大语言模型设计视觉令牌剪枝策略,以极小的性能损失实现高效率(在移除94.4%视觉令牌的同时保留99%的性能)。

早期剪枝学习!高效并行推理的路径剪枝方法

arXiv cs.CL

本文提出了 STOP(SuperTOken for Pruning),一个系统框架,用于在大型推理模型的并行推理中早期剪枝低效推理路径。该方法在 1.5B 到 20B 参数的模型中实现了优异的效率和效果,在固定计算预算下将 GPT-OSS-20B 在 AIME25 上的准确率从 84% 提升到 90%。