@bnjmn_marie:如果多次重试,Qwen3.8 27B 在 DeepSWE 1.1 上可以达到 92.04%,比 GPT-6 Astra 报告的约 74% 高出约 18 个百分点。我运行了 20 个配…

X AI KOLs Timeline 新闻

摘要

Qwen3.8 27B 通过重试在 DeepSWE 1.1 上达到 92.04%,超越了 GPT-6 Astra 的 74%,展示了较小模型在可靠性策略下的潜力。

如果多次重试,Qwen3.8 27B 在 DeepSWE 1.1 上可以达到 92.04%,比 GPT-6 Astra 报告的约 74% 高出约 18 个百分点。 我运行了 20 种配置,涵盖测试框架、思维级别和量化。覆盖率差异很大:两次运行都获得了 31.86% 的奖励,但在 42/113 个任务上存在分歧。这种情况主要出现在量化模型中。 我将每个任务的结果汇总:如果任何单一候选通过了所有新测试,则该任务通过。没有混合补丁。 最佳k次选择: k=1 → 81.43% F2P / 37.21% 奖励(这是单次运行的平均表现) k=10 → 98.31% / 86.25% k=20 → 99.18% / 92.04% 这是经过预言选择、跨配置的覆盖率,而不是单次运行的准确性。 这表明一个 27B 模型可以为大多数任务生成通过的解决方案。更困难的问题在于可靠性以及选择正确的候选。 通过强有力的独立接受和回归测试,重试以改进结果变得不那么不切实际:生成 → 验证 → 重试 → 通过时停止。 成本也很重要:想象一下,如果一次 Qwen 尝试的成本是前沿模型尝试的 1/20,那么 20 次重试在生成成本上约等于一次前沿模型尝试。但这只是一个假设,直到实际测量每次尝试的成本、验证、基础设施和延迟。
查看原文
查看缓存全文

缓存时间: 2026/09/16 08:01

若多次重试,Qwen3.8 27B在DeepSWE 1.1上可达92.04%,比GPT-6 Astra报告的约74%高出约18个百分点。

我测试了涵盖不同运行环境、思考层级和量化配置的20种方案。覆盖率差异显著:两个相同得分为31.86%的运行结果,在113项任务中有42项判断不一致,这种情况主要出现在量化模型中。

我按任务汇总了结果:只要任一候选方案通过所有新测试,该任务即视为通过。未采用混合补丁方案。

最佳k值选择: k=1 → 81.43% F2P / 37.25% 奖励值(单次运行的平均表现) k=10 → 98.31% / 86.25% k=20 → 99.18% / 92.04%

这是基于跨配置的预言机选择式覆盖率,而非单次运行准确率。它表明27B规模模型能为多数任务生成可行方案,更复杂的挑战在于稳定性与候选方案筛选。

若具备强大的独立验证与回归测试机制,通过重试优化结果将更具可行性:生成→验证→重试→通过即停。

成本因素同样关键:假设单次Qwen尝试成本为前沿模型的1/20,20次重试≈1次前沿模型生成成本。但这仅属假设,需实际测量单次成本、验证开销、基础设施及延迟后方能确认。

相似文章

Qwen 3.6 27B 在 DeepSWE 上的表现

Reddit r/LocalLLaMA

Qwen 3.6 27B 在 DeepSWE 基准测试中获得了 2% 的分数,排名 18/20,高于 Haiku 4.5 和 Minimax M2.7,突显了本地模型与前沿模型之间的差距。