在我的个人设置上测试了草稿链论文。相同答案减少了74%的令牌数。
摘要
作者在自己的设置上测试了草稿链论文,实现了相同答案减少74%的令牌数。
暂无内容
相似文章
将我的Agent令牌消耗削减72%(每个任务11.9k ➝ 3.3k)。以下是我所做的具体改动,附数据
一位开发者分享了通过精简系统提示、收紧检索、裁剪工具输出等技术,将AI Agent的令牌消耗降低72%的详细案例研究,且对成功率影响极小。
@_avichawla:只改了一处,Claude Code 的 token 消耗降到原来的 1/3:- 之前:1040 万 token · 10 个错误 · 9.21 美元 - 之后:370 万 token · 0 个错误 · 2.81 美元
用户把后端上下文层换成 Insforge Skills + CLI 后,Claude Code 的 token 用量减少 64%,错误归零,成本从 9.21 美元降到 2.81 美元。
[论文] 主要基准测试被发现存在污染,多达12%的问题有缺陷
本文审查了主要的LLM基准测试(GPQA、MMLU-Pro、MMMU-Pro),发现4.5%至11.8%的项目存在错误答案键或格式错误,并发布了修正后的‘Clean’版本供直接使用。
基准测试上25%的差异——只是运行方式的一个错误😬
讨论了ARC-AGI上25%的差异如何由测试框架设置导致,显示GPT-5.6 Sol在正确评估下得分38%,并批评了行业内天真的基准测试报告方式。
我测试了我的确定性AI金融验证引擎。核心部分通过了66/66,但实时LLM管道仅通过了19/66。
这篇文章报告了对确定性AI金融验证引擎的基准测试结果,显示在结构化声明上表现完美(66/66),但当使用LLM生成的声明时表现不佳(19/66),表明LLM与形式系统之间存在翻译差距。