标签
本文研究了在多种自然语言上使用人工语言对LLM进行预训练(预预训练)是否始终能提升token效率,发现其收益高度依赖于实验设置和随机种子,尽管对于使用Llama分词器的小模型,稳定收益在多数语言中出现。
Nous Research 的 Hermes 引入了浏览器使用模式,用基于 browser_use CLI 3.0 的单一脚本驱动方法取代了十二个浏览器工具,将 token 使用量削减 48-66%,且准确率无下降。
Dan Luu 对现有基准测试提出批评,这些测试声称动态语言对编程代理的 token 效率更高。他认为,琐碎的问题和有缺陷的评估使这些结论不可靠。
Dan Luu 批评了关于动态语言对 LLM 更节省 token 的说法,指出现有评估中的缺陷,并强调需要更好的基准测试方法。
The article introduces Revision Prompting, a technique for industrial LLM processes that improves speed, cost, and consistency when re-processing updated inputs by generating output patches from diffs.
Ix 是一款开源工具,可将软件架构映射为系统图,帮助 AI 模型更有效地理解代码库,同时将 token 使用量减少 30-99.7%。
一篇论文提出了一种结构化的会话压缩方法,将聊天历史建模为带有快照和分支的DAG,在保留语义的同时修剪冗余,在编码会话中平均削减20%的token。
一条推文认为,LLM 基准测试应在报告准确率的同时报告 token 使用量,并介绍了 VulcanBench,一个用于真实软件工程任务的开源基准,它跟踪 token 效率和成本。
Google 的博客文章介绍了 Genkit for Go 中对 Agent Skills 的支持,展示了渐进式披露如何让代理按需加载专业知识,从而减少 token 使用量并提高可靠性。
本文介绍了SIEVE,一种搜索-检查-获取策略,利用布尔查询语言使深度研究智能体仅检索相关文档片段,在多个基准数据集和智能体主干上,以节省20.7%-50.6%的令牌数实现了更高准确性。
得益于 Nvidia 的 Nemo Relay 以及多种优化策略,Hermes Agent 的效率大幅提升,尤其是对于更小/更弱的本地模型。这些优化包括减少任务轮次、降低上下文加载量,以及通过 25 万次对话消除 token 浪费。
本文认为,模型路由并不是真正要解决的问题——token 效率才是。文章倡导一种整体闭环方法,将更便宜的默认模型、偏好感知路由和更好的缓存(例如 Coinbase 将缓存命中率从 5% 提升到 60%)结合起来,以最大化每美元获得的有用智能。
Omar认为AI模型的token效率被低估,并引用Artificial Analysis的报告,指出DeepSeek完成基准测试任务的成本比Fable低105倍。
针对 MindControl(一种用于 llama.cpp 的采样器级引导推理预算)的基准测试结果显示出,多阶段信号传递可以在不损失准确率的情况下减少 token 消耗,并且在较简单任务上有时还能提升准确率。
ReToken引入了一个可学习的检索Token,从预填充的视觉KV缓存中选择与查询相关的稀疏视觉Token,从而提升视觉语言模型在视觉检索任务上的长上下文性能。它在图像和视频基准上均取得了一致的性能提升,同时可在单张H100上实现高效的长视频推理。
LangChain发布了Deep Agents v0.7,这是一个更精简的智能体框架,通过移除默认系统提示、精简工具描述以及将TodoListMiddleware设为可选,将基础输入令牌减少了65%,并在多个模型上验证了性能相当。
GPT-5.6 Sol,一个解决了开放数学问题的模型,最初由于测试框架的内存限制在 ARC-AGI-3 基准测试中表现不佳。启用两个 API 设置后,分数翻了三倍,输出令牌数减少了六倍。
一篇博客文章认为,Rails 的约定对于 AI 代理和编译器而言是理想之选,并引用提前编译的 Ruby 编译器 Spinel 作为例子,指出该编译器可能消除应用在扩展后需要重写的需求。
JetBrains在Claude Code上对Caveman token压缩技能进行了基准测试,涵盖86个任务,发现实际的输出token节省约为8.5%(并非宣传的65%),且任务质量没有可检测的下降。
本文反思了开发者对AI代码助手的迅速采用,以及随着AI使用变得更加企业化和计量化,对令牌效率和成本指标的关注日益突出。