Qwen 3.8 27b 今晚为我节省了超过650美元的API费用

Reddit r/LocalLLaMA 新闻

摘要

作者使用 DeepSeek Harness 本地运行 Qwen3.8-27B,实现了快速推理,并相比等效工作负载的 API 成本节省了超过 650 美元。

我一直在使用 DeepSeek Harness 实验 Qwen3.8-27B。它在长期任务上表现惊人,结果相当疯狂。DeepSeek Harness 运行在我的 Windows PC 上,并通过局域网连接到单独 RTX PRO 6000 盒子上的 NInfer。模型是 Qwen3.8-27B,具有 262K 的上下文窗口。所有 shell 命令和文件操作都在客户端 PC 上进行。服务器只进行推理。量化是 NInfer 的 groupwise-int 工件,使用混合的 Q4/Q5/Q6 分配。我计划接下来尝试 NInfer 支持的 NVFP4 配置文件。 在超过 8 小时的运行中,有 966 次模型调用,任务输入 130.2M 令牌,输出 812.5K 令牌;包括压缩后,输入 131.2M,输出 853.3K。有 972 次面向模型的工具调用,1,421 次实际本地工具操作,31 次自动压缩尝试,加权解码速度为 104.83 输出令牌/秒,模型生成失败次数为零。 上下文大小变得巨大。根请求的中位数为 136.6K 令牌,p95 为 205.9K,最大为 231.2K。工具在每个输出令牌上推送大约 160 个输入令牌。重复上下文成为主要工作负载并不奇怪。有趣的是,生成本身很快。将逻辑输入除以总首次令牌时间,得到根约为 12.4K 提示令牌/秒,根加子代理约为 8.5K。这不是原始 GPU PP/s,因为它包括队列时间和可能重用的前缀,但作为客户端数字仍然有用。根首次令牌时间中位数为 0.8 秒,但 p95 为 136 秒。子代理的中位数为 151 秒,而其中位解码阶段仅为 5.3 秒。一旦 NInfer 将请求放在 GPU 上,它飞速运行。针对一个端点运行两个代理主要增加了队列和预填充争用。 1,421 次本地操作包括 576 次 PowerShell 调用,259 次读取,221 次编辑,161 次写入,和 114 次搜索。只有 30 次失败,本地工具层的错误率为 2.11%。文件工具大多在毫秒内完成。 通过 API 这会花费多少?本地运行没有令牌费用,但我使用当前 API 费率(不包含缓存折扣)为完整的 131.2M 输入和 853.3K 输出工作负载定价。 模型 估算 API 成本:DeepSeek V4 Flash $18.61,GPT-5.6 Luna $27.26,Claude Sonnet 5 $270.93,Claude Opus 4.6 $677.32。 定价参考:DeepSeek、OpenAI、Sonnet 5 和 Opus 4.6。这太疯狂了。我知道成本并不完美,因为 DS V4 Flash 0731 经常命中缓存等,但尽管如此。 它大约输出 105 令牌/秒。问题在于重复的六位数提示、预填充和两个代理竞争一个推理端点。感觉我今天赚钱了。疯狂的是,它在没有任何模型生成失败的情况下达到了最终目标。
查看原文

相似文章

Qwen 3.6 27B 在 DeepSWE 上的表现

Reddit r/LocalLLaMA

Qwen 3.6 27B 在 DeepSWE 基准测试中获得了 2% 的分数,排名 18/20,高于 Haiku 4.5 和 Minimax M2.7,突显了本地模型与前沿模型之间的差距。

Qwen 3.8 27b 发布:本地AI的重大新闻

Reddit r/ArtificialInteligence

Qwen 3.8 27b,一个参数小于300亿的AI模型,已经发布,适合在消费级硬件如RTX 3090或M4 Pro上进行本地推理,有可能取代基于云的AI订阅,并将工作流程转移到本地。