标签
一位开发者分享了他们如何通过前缀缓存优化,将 DeepSeek API 成本削减约 90%,将浏览器代理任务成本降至 0.005 美元以下,并实现了一个免费、由广告支持的浏览器代理。
AI 智能体工具集中未使用的工具仍然会消耗令牌,并给工具选择增加噪音,因此智能体应只加载当前任务所需的工具。
一个实验测试了编码 CLI 是否真的读取 AGENTS.md,结果发现该文件被静默忽略;即使被读取,臃肿的指令文件也会增加 token 成本且无法提升性能。作者建议只写入模型无法从代码中推断出的内容。
一位开发者在AI智能体内对13种搜索API配置进行了基准测试,发现读取负载的隐藏token成本可能占据总账单的大部分,而且不同提供商之间的差异高达67倍。
一条推文指出,Claude Code 的大部分 token 费用来自每次编辑时重新读取整个代码库,并重点介绍了一类新工具,它们通过代码库映射、上下文剪枝和项目记忆大幅减少 token 使用量,链接文章中列出了 10 个这样的工具。
一篇论文发现,Self-Refine 和 Reflexion 等自我反思循环在 1.5B 到 7B 的开源模型上,以相同的 token 成本并未优于重复采样,所有 18 项自我检查比较均为负面结果。
有人将Codex无限子弹方法开源,利用Sol负责规划和Luna Max负责执行,可在简单任务上节省约59%的token成本,复杂任务节省65%。
作者讨论了AI代理陷入工具循环的问题,并提议构建一个名为'Moven AI'的开源SDK,它充当断路器,在失控代理产生过高成本之前中止运行。
最新基准测试显示,在8个B300节点上自托管Kimi K3实现了86.4%的任务解决率,硬件成本大约比在B200节点上运行的GLM-5.2高出20%,尽管吞吐量较低。
在一次Codex运行浪费了超过10万tokens且未能完成任务后,作者构建了一个能够可靠完成代码生成工作的工具。
NVIDIA详细介绍了其与PyTorch等开源生态系统共同开发的全栈推理软件,如何在Blackwell GPU上将令牌成本降低多达5倍,来自Baseten、Cognition、Deep Infra等的实际部署展示了性能提升。
NVIDIA宣布Vera Rubin平台,每兆瓦吞吐量比Blackwell提升10倍,并通过跨越七颗芯片和五个机架托盘的极致协同设计,为AI工厂提供最低的代币成本。
Chamath 透露其公司发现 AI token 成本每 45 天翻倍,但下游生产力提升最多 5%,认为 AI 发展正接近瓶颈,建议公司重新审视策略甚至考虑退出。
查马斯揭露AI行业成本与收益的残酷真相:token成本每45天翻一番,但下游生产力提升最多只有5%,大模型能力提升已达渐近线,未来3-4年内每家公司都将面临成本与收益的终极清算。
Meta对其Muse Spark 1.1模型的激进定价压低了OpenAI和Anthropic等竞争对手的价格,可能引发一场代币价格战,从而降低成本、防止双寡头垄断,并推动应用层的创新。
Fable 5 模型仅通过4个提示词和173美元token就制作了一款名为《超级智能竞速赛》的游戏,展示了极强的生成能力。
NVIDIA全栈推理软件与硬件协同设计,仅一个月内就在Blackwell平台上将Token成本降低多达5倍,为AI工厂实现更低的每Token成本。Baseten、Cognition、Deep Infra和Together AI等公司正在使用该软件栈优化推理性能。
一份报告指出,在轨道上运营AI数据中心每个token的成本是地面数据中心的8到12倍,凸显了太空AI计算面临的重大成本障碍。
Bellwethr 正在开发一种开放方法,用于追踪来自高性能模型的单个推理 token 的实际美元成本,目前基准测试套件草案和社区贡献正在进行中。
宣布 mattpocock/skills 版本1,这是一组AI技能定义,可将token成本降低63%,并引入了新的技能,用于代码库设计、领域建模等。