标签
Google 的博客文章介绍了 Genkit for Go 中对 Agent Skills 的支持,展示了渐进式披露如何让代理按需加载专业知识,从而减少 token 使用量并提高可靠性。
本文介绍了SIEVE,一种搜索-检查-获取策略,利用布尔查询语言使深度研究智能体仅检索相关文档片段,在多个基准数据集和智能体主干上,以节省20.7%-50.6%的令牌数实现了更高准确性。
得益于 Nvidia 的 Nemo Relay 以及多种优化策略,Hermes Agent 的效率大幅提升,尤其是对于更小/更弱的本地模型。这些优化包括减少任务轮次、降低上下文加载量,以及通过 25 万次对话消除 token 浪费。
本文认为,模型路由并不是真正要解决的问题——token 效率才是。文章倡导一种整体闭环方法,将更便宜的默认模型、偏好感知路由和更好的缓存(例如 Coinbase 将缓存命中率从 5% 提升到 60%)结合起来,以最大化每美元获得的有用智能。
Omar认为AI模型的token效率被低估,并引用Artificial Analysis的报告,指出DeepSeek完成基准测试任务的成本比Fable低105倍。
针对 MindControl(一种用于 llama.cpp 的采样器级引导推理预算)的基准测试结果显示出,多阶段信号传递可以在不损失准确率的情况下减少 token 消耗,并且在较简单任务上有时还能提升准确率。
ReToken引入了一个可学习的检索Token,从预填充的视觉KV缓存中选择与查询相关的稀疏视觉Token,从而提升视觉语言模型在视觉检索任务上的长上下文性能。它在图像和视频基准上均取得了一致的性能提升,同时可在单张H100上实现高效的长视频推理。
LangChain发布了Deep Agents v0.7,这是一个更精简的智能体框架,通过移除默认系统提示、精简工具描述以及将TodoListMiddleware设为可选,将基础输入令牌减少了65%,并在多个模型上验证了性能相当。
GPT-5.6 Sol,一个解决了开放数学问题的模型,最初由于测试框架的内存限制在 ARC-AGI-3 基准测试中表现不佳。启用两个 API 设置后,分数翻了三倍,输出令牌数减少了六倍。
一篇博客文章认为,Rails 的约定对于 AI 代理和编译器而言是理想之选,并引用提前编译的 Ruby 编译器 Spinel 作为例子,指出该编译器可能消除应用在扩展后需要重写的需求。
JetBrains在Claude Code上对Caveman token压缩技能进行了基准测试,涵盖86个任务,发现实际的输出token节省约为8.5%(并非宣传的65%),且任务质量没有可检测的下降。
本文反思了开发者对AI代码助手的迅速采用,以及随着AI使用变得更加企业化和计量化,对令牌效率和成本指标的关注日益突出。
介绍Latent Briefing,一种通过KV缓存压缩实现多智能体系统通信的方法,在保持相同准确率的情况下减少31%的令牌使用,并实现高达20倍的加速。
一位开发者对 Rote 进行了基准测试,Rote 是一个浏览器代理的内存管理器,它发送页面差异而非完整重渲染,结果显示与 Browser Use 相比,令牌增长减少了 37%,但在短任务上存在权衡。
Anthropic 发布了 Opus 5,专注于 Token 效率和成本降低,而非重大的能力飞跃,提供接近 Fable 的性能,成本减半。
本文提出 Agentic Context Management(ACM),将智能体记忆视为包含五个原语的生命周期问题,并介绍了参考实现 Maximem Synap,该实现取得了强劲的基准测试结果。
Grok Build 新增了代币使用跟踪、模型配置、提示批量处理和诊断功能,以帮助开发者提高代币效率。
Google 宣布推出 Gemini 3.6 Flash,其编码效率提升且令牌成本降低,同时发布 Gemini 3.5 Flash Lite 和一款专注于网络安全的模型,而 Gemini 3.5 Pro 仍在开发中,并暗示了 Gemini 4。
A user reports that using three local AI models (GLM 5.2, DeepSeek v4 Flash, Qwen 3.6 35B A3B) over 7 days with 500 million tokens can cover most business automation needs.