标签
The article clarifies the differences between AGENTS.md, SKILL.md, and related files in AI agent development, emphasizing their roles in cost efficiency and context management to prevent drift.
一位开发者分享了他们如何通过前缀缓存优化,将 DeepSeek API 成本削减约 90%,将浏览器代理任务成本降至 0.005 美元以下,并实现了一个免费、由广告支持的浏览器代理。
AI 智能体工具集中未使用的工具仍然会消耗令牌,并给工具选择增加噪音,因此智能体应只加载当前任务所需的工具。
一个实验测试了编码 CLI 是否真的读取 AGENTS.md,结果发现该文件被静默忽略;即使被读取,臃肿的指令文件也会增加 token 成本且无法提升性能。作者建议只写入模型无法从代码中推断出的内容。
一位开发者在AI智能体内对13种搜索API配置进行了基准测试,发现读取负载的隐藏token成本可能占据总账单的大部分,而且不同提供商之间的差异高达67倍。
一条推文指出,Claude Code 的大部分 token 费用来自每次编辑时重新读取整个代码库,并重点介绍了一类新工具,它们通过代码库映射、上下文剪枝和项目记忆大幅减少 token 使用量,链接文章中列出了 10 个这样的工具。
一篇论文发现,Self-Refine 和 Reflexion 等自我反思循环在 1.5B 到 7B 的开源模型上,以相同的 token 成本并未优于重复采样,所有 18 项自我检查比较均为负面结果。
有人将Codex无限子弹方法开源,利用Sol负责规划和Luna Max负责执行,可在简单任务上节省约59%的token成本,复杂任务节省65%。
作者讨论了AI代理陷入工具循环的问题,并提议构建一个名为'Moven AI'的开源SDK,它充当断路器,在失控代理产生过高成本之前中止运行。
最新基准测试显示,在8个B300节点上自托管Kimi K3实现了86.4%的任务解决率,硬件成本大约比在B200节点上运行的GLM-5.2高出20%,尽管吞吐量较低。
在一次Codex运行浪费了超过10万tokens且未能完成任务后,作者构建了一个能够可靠完成代码生成工作的工具。
NVIDIA详细介绍了其与PyTorch等开源生态系统共同开发的全栈推理软件,如何在Blackwell GPU上将令牌成本降低多达5倍,来自Baseten、Cognition、Deep Infra等的实际部署展示了性能提升。
NVIDIA宣布Vera Rubin平台,每兆瓦吞吐量比Blackwell提升10倍,并通过跨越七颗芯片和五个机架托盘的极致协同设计,为AI工厂提供最低的代币成本。
Chamath 透露其公司发现 AI token 成本每 45 天翻倍,但下游生产力提升最多 5%,认为 AI 发展正接近瓶颈,建议公司重新审视策略甚至考虑退出。
查马斯揭露AI行业成本与收益的残酷真相:token成本每45天翻一番,但下游生产力提升最多只有5%,大模型能力提升已达渐近线,未来3-4年内每家公司都将面临成本与收益的终极清算。
Meta对其Muse Spark 1.1模型的激进定价压低了OpenAI和Anthropic等竞争对手的价格,可能引发一场代币价格战,从而降低成本、防止双寡头垄断,并推动应用层的创新。
Fable 5 模型仅通过4个提示词和173美元token就制作了一款名为《超级智能竞速赛》的游戏,展示了极强的生成能力。
NVIDIA全栈推理软件与硬件协同设计,仅一个月内就在Blackwell平台上将Token成本降低多达5倍,为AI工厂实现更低的每Token成本。Baseten、Cognition、Deep Infra和Together AI等公司正在使用该软件栈优化推理性能。
一份报告指出,在轨道上运营AI数据中心每个token的成本是地面数据中心的8到12倍,凸显了太空AI计算面临的重大成本障碍。
Bellwethr 正在开发一种开放方法,用于追踪来自高性能模型的单个推理 token 的实际美元成本,目前基准测试套件草案和社区贡献正在进行中。