@omarsar0: 我一直说这些模型的token效率被低估了。对这些模型要更有野心。尝试不同……
摘要
Omar认为AI模型的token效率被低估,并引用Artificial Analysis的报告,指出DeepSeek完成基准测试任务的成本比Fable低105倍。
查看缓存全文
缓存时间: 2026/08/03 09:39
我一直说这些模型的 token 效率被低估了。对这些模型要更大胆一些。试试不同的 harness(工作框架)。
按需计量的智能已经太便宜了,这时代已经来了!
Cline(@cline): 虽然 DeepSeek V4-Flash 在每 token 价格上明显更便宜,但如果因为交互轮次更多导致单任务总成本更高,那么这个价格优势可能会产生误导。
不过,@ArtificialAnlys 报告称,DeepSeek 完成与 Fable 相同的基准测试任务,成本却低了 105 倍。
相似文章
每百万Token的价格毫无意义
本文认为,由于分词器和Token效率的差异,按每百万Token价格比较AI模型会产生误导。文章提供了一个基准成本分析,表明每Token价格较高的模型在完成每个任务时反而可能更便宜,其中DeepSeek V4 Pro是一个突出的成本效率异常值。
@omarsar0: 这只是一个数据点,但我认为开放模型的令牌份额将继续上升。你可以通过更深入地观察……来获得更多信息。
该帖子认为,由于多智能体系统的成本效益,开放模型的令牌份额将上升,引用数据显示开源AI正在从OpenAI和Anthropic手中夺取市场份额。
单token便宜,单任务昂贵:AI模型定价与性能对比 [OC]
本文分析了像Anthropic的Opus 5.5和ChatGPT的Astra等AI模型的成本效益,使用Artificial Analysis分数来比较单token定价与任务完成效率。
@omarsar0: 强烈推荐阅读。"与纯Fable相比,Fable + Sidekick将成本降低了54%,而分数几乎保持不变。"…
这条推文推荐阅读关于将Fable模型与Sidekick结合使用可将成本降低54%同时保持几乎相同的性能得分,并推测类似模式可能适用于未来的GPT模型。
同一AI模型。更好的结果。更低的成本。
作者认为,AI编码工具链和模型路由与模型本身同样重要,分享了使用Oh-My-Pi和OpenCode进行的测试,这些测试减少了token使用量和错误,并推荐针对高容量、轻量级任务采用分层模型订阅。