token-efficiency

标签

Cards List
#token-efficiency

Revision Prompting improves industrial LLM processes

Lobsters Hottest · 15小时前 缓存

The article introduces Revision Prompting, a technique for industrial LLM processes that improves speed, cost, and consistency when re-processing updated inputs by generating output patches from diffs.

0 人收藏 0 人点赞
#token-efficiency

@tom_doerr: Ix 将软件架构映射为系统图,以改善 AI 推理并减少 token 使用量。 https://gi…

X AI KOLs Timeline · 昨天 缓存

Ix 是一款开源工具,可将软件架构映射为系统图,帮助 AI 模型更有效地理解代码库,同时将 token 使用量减少 30-99.7%。

0 人收藏 0 人点赞
#token-efficiency

@zostaff:这篇论文彻底改变了我对会话压缩的看法:建模DAG -> 快照 -> 分支 -> 修剪结构…

X AI KOLs Timeline · 4天前 缓存

一篇论文提出了一种结构化的会话压缩方法,将聊天历史建模为带有快照和分支的DAG,在保留语义的同时修剪冗余,在编码会话中平均削减20%的token。

0 人收藏 0 人点赞
#token-efficiency

@grok:好吧,我就直说了。我们必须开始在分享模型性能的同时分享 token 使用量。我不认为…

X AI KOLs Following · 5天前 缓存

一条推文认为,LLM 基准测试应在报告准确率的同时报告 token 使用量,并介绍了 VulcanBench,一个用于真实软件工程任务的开源基准,它跟踪 token 效率和成本。

0 人收藏 0 人点赞
#token-efficiency

@googledevs:让代理的上下文保持精简,同时不牺牲专业知识。了解 Genkit Go 中的 Agent Skills 如何将专业化知识打包为…

X AI KOLs Timeline · 5天前 缓存

Google 的博客文章介绍了 Genkit for Go 中对 Agent Skills 的支持,展示了渐进式披露如何让代理按需加载专业知识,从而减少 token 使用量并提高可靠性。

0 人收藏 0 人点赞
#token-efficiency

搜索、检查、获取:利用布尔检索赋能深度研究智能体

Hugging Face Daily Papers · 6天前 缓存

本文介绍了SIEVE,一种搜索-检查-获取策略,利用布尔查询语言使深度研究智能体仅检索相关文档片段,在多个基准数据集和智能体主干上,以节省20.7%-50.6%的令牌数实现了更高准确性。

0 人收藏 0 人点赞
#token-efficiency

@Teknium:Hermes Agent 现在效率大幅提升,尤其是对于更小/更弱/本地模型!借助 @nvidia 的…

X AI KOLs Following · 6天前 缓存

得益于 Nvidia 的 Nemo Relay 以及多种优化策略,Hermes Agent 的效率大幅提升,尤其是对于更小/更弱的本地模型。这些优化包括减少任务轮次、降低上下文加载量,以及通过 25 万次对话消除 token 浪费。

0 人收藏 0 人点赞
#token-efficiency

LLM 路由不是要解决的问题;token 效率才是

Reddit r/AI_Agents · 6天前

本文认为,模型路由并不是真正要解决的问题——token 效率才是。文章倡导一种整体闭环方法,将更便宜的默认模型、偏好感知路由和更好的缓存(例如 Coinbase 将缓存命中率从 5% 提升到 60%)结合起来,以最大化每美元获得的有用智能。

0 人收藏 0 人点赞
#token-efficiency

@omarsar0: 我一直说这些模型的token效率被低估了。对这些模型要更有野心。尝试不同……

X AI KOLs Following · 2026-08-01 缓存

Omar认为AI模型的token效率被低估,并引用Artificial Analysis的报告,指出DeepSeek完成基准测试任务的成本比Fable低105倍。

0 人收藏 0 人点赞
#token-efficiency

基准测试:用于 llama.cpp 的 MindControl

Reddit r/LocalLLaMA · 2026-07-30

针对 MindControl(一种用于 llama.cpp 的采样器级引导推理预算)的基准测试结果显示出,多阶段信号传递可以在不损失准确率的情况下减少 token 消耗,并且在较简单任务上有时还能提升准确率。

0 人收藏 0 人点赞
#token-efficiency

ReToken:一个Token提升视觉语言模型的视觉检索能力

Hugging Face Daily Papers · 2026-07-30 缓存

ReToken引入了一个可学习的检索Token,从预填充的视觉KV缓存中选择与查询相关的稀疏视觉Token,从而提升视觉语言模型在视觉检索任务上的长上下文性能。它在图像和视频基准上均取得了一致的性能提升,同时可在单张H100上实现高效的长视频推理。

0 人收藏 0 人点赞
#token-efficiency

Deep Agents v0.7(6分钟阅读)

TLDR AI · 2026-07-30 缓存

LangChain发布了Deep Agents v0.7,这是一个更精简的智能体框架,通过移除默认系统提示、精简工具描述以及将TodoListMiddleware设为可选,将基础输入令牌减少了65%,并在多个模型上验证了性能相当。

0 人收藏 0 人点赞
#token-efficiency

@OpenAI:GPT-5.6 Sol 已被用于解决数学中的开放性问题。那为什么它在 ARC-AGI-3,一个基准测试中…

X AI KOLs · 2026-07-29 缓存

GPT-5.6 Sol,一个解决了开放数学问题的模型,最初由于测试框架的内存限制在 ARC-AGI-3 基准测试中表现不佳。启用两个 API 设置后,分数翻了三倍,输出令牌数减少了六倍。

0 人收藏 0 人点赞
#token-efficiency

Lobste.rs 关于 Spinel 的讨论

Lobsters Hottest · 2026-07-29 缓存

一篇博客文章认为,Rails 的约定对于 AI 代理和编译器而言是理想之选,并引用提前编译的 Ruby 编译器 Spinel 作为例子,指出该编译器可能消除应用在扩展后需要重写的需求。

0 人收藏 0 人点赞
#token-efficiency

像穴居人一样与智能体对话能节省65%的Token吗?我们测试了

Hacker News Top · 2026-07-28 缓存

JetBrains在Claude Code上对Caveman token压缩技能进行了基准测试,涵盖86个任务,发现实际的输出token节省约为8.5%(并非宣传的65%),且任务质量没有可检测的下降。

0 人收藏 0 人点赞
#token-efficiency

令牌效率的时代,库的时代

Hacker News Top · 2026-07-28 缓存

本文反思了开发者对AI代码助手的迅速采用,以及随着AI使用变得更加企业化和计量化,对令牌效率和成本指标的关注日益突出。

0 人收藏 0 人点赞
#token-efficiency

PorTAL(1分钟阅读)

TLDR AI · 2026-07-28 缓存

介绍Latent Briefing,一种通过KV缓存压缩实现多智能体系统通信的方法,在保持相同准确率的情况下减少31%的令牌使用,并实现高达20倍的加速。

0 人收藏 0 人点赞
#token-efficiency

我在一个真实站点上对我的浏览器代理与 Browser Use 进行了基准测试(150次验证运行,同一模型)。发送页面差异而非完整重渲染,使得令牌增长减少了37%。

Reddit r/AI_Agents · 2026-07-25

一位开发者对 Rote 进行了基准测试,Rote 是一个浏览器代理的内存管理器,它发送页面差异而非完整重渲染,结果显示与 Browser Use 相比,令牌增长减少了 37%,但在短任务上存在权衡。

0 人收藏 0 人点赞
#token-efficiency

Anthropic 的 Opus 5 关乎 Token 效率,而非能力飞跃

Ars Technica · 2026-07-24 缓存

Anthropic 发布了 Opus 5,专注于 Token 效率和成本降低,而非重大的能力飞跃,提供接近 Fable 的性能,成本减半。

0 人收藏 0 人点赞
#token-efficiency

在我的个人设置上测试了草稿链论文。相同答案减少了74%的令牌数。

Reddit r/AI_Agents · 2026-07-24

作者在自己的设置上测试了草稿链论文,实现了相同答案减少74%的令牌数。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈