token-efficiency

标签

Cards List
#token-efficiency

@googledevs:让代理的上下文保持精简,同时不牺牲专业知识。了解 Genkit Go 中的 Agent Skills 如何将专业化知识打包为…

X AI KOLs Timeline ↗ · 2026-08-03 缓存

Google 的博客文章介绍了 Genkit for Go 中对 Agent Skills 的支持,展示了渐进式披露如何让代理按需加载专业知识,从而减少 token 使用量并提高可靠性。

0 人收藏 0 人点赞
#token-efficiency

搜索、检查、获取:利用布尔检索赋能深度研究智能体

Hugging Face Daily Papers ↗ · 2026-08-03 缓存

本文介绍了SIEVE,一种搜索-检查-获取策略,利用布尔查询语言使深度研究智能体仅检索相关文档片段,在多个基准数据集和智能体主干上,以节省20.7%-50.6%的令牌数实现了更高准确性。

0 人收藏 0 人点赞
#token-efficiency

@Teknium:Hermes Agent 现在效率大幅提升,尤其是对于更小/更弱/本地模型!借助 @nvidia 的…

X AI KOLs Following ↗ · 2026-08-02 缓存

得益于 Nvidia 的 Nemo Relay 以及多种优化策略,Hermes Agent 的效率大幅提升,尤其是对于更小/更弱的本地模型。这些优化包括减少任务轮次、降低上下文加载量,以及通过 25 万次对话消除 token 浪费。

0 人收藏 0 人点赞
#token-efficiency

LLM 路由不是要解决的问题;token 效率才是

Reddit r/AI_Agents ↗ · 2026-08-02

本文认为,模型路由并不是真正要解决的问题——token 效率才是。文章倡导一种整体闭环方法,将更便宜的默认模型、偏好感知路由和更好的缓存(例如 Coinbase 将缓存命中率从 5% 提升到 60%)结合起来,以最大化每美元获得的有用智能。

0 人收藏 0 人点赞
#token-efficiency

@omarsar0: 我一直说这些模型的token效率被低估了。对这些模型要更有野心。尝试不同……

X AI KOLs Following ↗ · 2026-08-01 缓存

Omar认为AI模型的token效率被低估,并引用Artificial Analysis的报告,指出DeepSeek完成基准测试任务的成本比Fable低105倍。

0 人收藏 0 人点赞
#token-efficiency

基准测试:用于 llama.cpp 的 MindControl

Reddit r/LocalLLaMA ↗ · 2026-07-30

针对 MindControl(一种用于 llama.cpp 的采样器级引导推理预算)的基准测试结果显示出,多阶段信号传递可以在不损失准确率的情况下减少 token 消耗,并且在较简单任务上有时还能提升准确率。

0 人收藏 0 人点赞
#token-efficiency

ReToken:一个Token提升视觉语言模型的视觉检索能力

Hugging Face Daily Papers ↗ · 2026-07-30 缓存

ReToken引入了一个可学习的检索Token,从预填充的视觉KV缓存中选择与查询相关的稀疏视觉Token,从而提升视觉语言模型在视觉检索任务上的长上下文性能。它在图像和视频基准上均取得了一致的性能提升,同时可在单张H100上实现高效的长视频推理。

0 人收藏 0 人点赞
#token-efficiency

Deep Agents v0.7(6分钟阅读)

TLDR AI ↗ · 2026-07-30 缓存

LangChain发布了Deep Agents v0.7,这是一个更精简的智能体框架,通过移除默认系统提示、精简工具描述以及将TodoListMiddleware设为可选,将基础输入令牌减少了65%,并在多个模型上验证了性能相当。

0 人收藏 0 人点赞
#token-efficiency

@OpenAI:GPT-5.6 Sol 已被用于解决数学中的开放性问题。那为什么它在 ARC-AGI-3,一个基准测试中…

X AI KOLs ↗ · 2026-07-29 缓存

GPT-5.6 Sol,一个解决了开放数学问题的模型,最初由于测试框架的内存限制在 ARC-AGI-3 基准测试中表现不佳。启用两个 API 设置后,分数翻了三倍,输出令牌数减少了六倍。

0 人收藏 0 人点赞
#token-efficiency

Lobste.rs 关于 Spinel 的讨论

Lobsters Hottest ↗ · 2026-07-29 缓存

一篇博客文章认为,Rails 的约定对于 AI 代理和编译器而言是理想之选,并引用提前编译的 Ruby 编译器 Spinel 作为例子,指出该编译器可能消除应用在扩展后需要重写的需求。

0 人收藏 0 人点赞
#token-efficiency

像穴居人一样与智能体对话能节省65%的Token吗?我们测试了

Hacker News Top ↗ · 2026-07-28 缓存

JetBrains在Claude Code上对Caveman token压缩技能进行了基准测试,涵盖86个任务,发现实际的输出token节省约为8.5%(并非宣传的65%),且任务质量没有可检测的下降。

0 人收藏 0 人点赞
#token-efficiency

令牌效率的时代,库的时代

Hacker News Top ↗ · 2026-07-28 缓存

本文反思了开发者对AI代码助手的迅速采用,以及随着AI使用变得更加企业化和计量化,对令牌效率和成本指标的关注日益突出。

0 人收藏 0 人点赞
#token-efficiency

PorTAL(1分钟阅读)

TLDR AI ↗ · 2026-07-28 缓存

介绍Latent Briefing,一种通过KV缓存压缩实现多智能体系统通信的方法,在保持相同准确率的情况下减少31%的令牌使用,并实现高达20倍的加速。

0 人收藏 0 人点赞
#token-efficiency

我在一个真实站点上对我的浏览器代理与 Browser Use 进行了基准测试(150次验证运行,同一模型)。发送页面差异而非完整重渲染,使得令牌增长减少了37%。

Reddit r/AI_Agents ↗ · 2026-07-25

一位开发者对 Rote 进行了基准测试,Rote 是一个浏览器代理的内存管理器,它发送页面差异而非完整重渲染,结果显示与 Browser Use 相比,令牌增长减少了 37%,但在短任务上存在权衡。

0 人收藏 0 人点赞
#token-efficiency

Anthropic 的 Opus 5 关乎 Token 效率,而非能力飞跃

Ars Technica ↗ · 2026-07-24 缓存

Anthropic 发布了 Opus 5,专注于 Token 效率和成本降低,而非重大的能力飞跃,提供接近 Fable 的性能,成本减半。

0 人收藏 0 人点赞
#token-efficiency

在我的个人设置上测试了草稿链论文。相同答案减少了74%的令牌数。

Reddit r/AI_Agents ↗ · 2026-07-24

作者在自己的设置上测试了草稿链论文,实现了相同答案减少74%的令牌数。

0 人收藏 0 人点赞
#token-efficiency

Agentic Context Management:将智能体记忆与成本作为生命周期与架构问题来解决

Hugging Face Daily Papers ↗ · 2026-07-23 缓存

本文提出 Agentic Context Management(ACM),将智能体记忆视为包含五个原语的生命周期问题,并介绍了参考实现 Maximem Synap,该实现取得了强劲的基准测试结果。

0 人收藏 0 人点赞
#token-efficiency

@elonmusk: Grok Build 正在添加功能以帮助您跟踪和提高代币效率

X AI KOLs Timeline ↗ · 2026-07-22 缓存

Grok Build 新增了代币使用跟踪、模型配置、提示批量处理和诊断功能,以帮助开发者提高代币效率。

0 人收藏 0 人点赞
#token-efficiency

Google 发布 Gemini 3.6 Flash 与网络安全 AI,预告 3.5 Pro 和 Gemini 4

Ars Technica ↗ · 2026-07-21 缓存

Google 宣布推出 Gemini 3.6 Flash,其编码效率提升且令牌成本降低,同时发布 Gemini 3.5 Flash Lite 和一款专注于网络安全的模型,而 Gemini 3.5 Pro 仍在开发中,并暗示了 Gemini 4。

0 人收藏 0 人点赞
#token-efficiency

@YRSM_Simon: 7天,5亿token,Local AI GLM 5.2,deepseek v4 flash,Qwen 3.6 35B A3B,三个模型几乎能满足绝大部分业务自动化需求了

X AI KOLs Following ↗ · 2026-07-21 缓存

A user reports that using three local AI models (GLM 5.2, DeepSeek v4 Flash, Qwen 3.6 35B A3B) over 7 days with 500 million tokens can cover most business automation needs.

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈