@bnjmn_marie:如果多次重试,Qwen3.8 27B 在 DeepSWE 1.1 上可以达到 92.04%,比 GPT-6 Astra 报告的约 74% 高出约 18 个百分点。我运行了 20 个配…
摘要
Qwen3.8 27B 通过重试在 DeepSWE 1.1 上达到 92.04%,超越了 GPT-6 Astra 的 74%,展示了较小模型在可靠性策略下的潜力。
查看缓存全文
缓存时间: 2026/09/16 08:01
若多次重试,Qwen3.8 27B在DeepSWE 1.1上可达92.04%,比GPT-6 Astra报告的约74%高出约18个百分点。
我测试了涵盖不同运行环境、思考层级和量化配置的20种方案。覆盖率差异显著:两个相同得分为31.86%的运行结果,在113项任务中有42项判断不一致,这种情况主要出现在量化模型中。
我按任务汇总了结果:只要任一候选方案通过所有新测试,该任务即视为通过。未采用混合补丁方案。
最佳k值选择: k=1 → 81.43% F2P / 37.25% 奖励值(单次运行的平均表现) k=10 → 98.31% / 86.25% k=20 → 99.18% / 92.04%
这是基于跨配置的预言机选择式覆盖率,而非单次运行准确率。它表明27B规模模型能为多数任务生成可行方案,更复杂的挑战在于稳定性与候选方案筛选。
若具备强大的独立验证与回归测试机制,通过重试优化结果将更具可行性:生成→验证→重试→通过即停。
成本因素同样关键:假设单次Qwen尝试成本为前沿模型的1/20,20次重试≈1次前沿模型生成成本。但这仅属假设,需实际测量单次成本、验证开销、基础设施及延迟后方能确认。
相似文章
Qwen3.7 Max在Artificial Analysis评测中得分,27B/35B等待室
Qwen3.7 Max在Artificial Analysis基准测试中排名第五,与GPT-5.4持平,并超越了刚发布的Gemini 3.5 Flash,而Qwen3.6 27B则明显落后。
Qwen 3.6 27B 在 DeepSWE 上的表现
Qwen 3.6 27B 在 DeepSWE 基准测试中获得了 2% 的分数,排名 18/20,高于 Haiku 4.5 和 Minimax M2.7,突显了本地模型与前沿模型之间的差距。
Qwen3.8-27B在人工分析基准测试中与DeepSeek V4和GPT-5.6 Luna Max并驾齐驱。您现在只需一块RTX 3090就能运行一个接近前沿的模型。
Qwen3.8-27B是一款新AI模型,在人工分析基准测试中与DeepSeek V4和GPT-5.6 Luna Max等前沿模型性能相当,并且可以在RTX 3090 GPU上本地运行。
你认为这有多准确?Qwen3.5 9B 对比 GPT-4o
这篇文章质疑在资源有限的系统上运行的 Qwen 3.5 9B 是否能超越 GPT-4o,突出了其小于 7 GB 的小巧尺寸和声称的优越性能。
@populartourist: Qwen3.6 27B 和 35B-A3B 是出色的模型,但目前还没有任何模型能达到GPT-OSS的效率。Qwen3.6 35B-A3B 与…
一条推文比较了Qwen3.6 27B和35B-A3B模型与GPT-OSS,指出虽然Qwen模型很快,但GPT-OSS更高效,尤其是在预填充性能方面。