你认为几个通义千问3.8-27B模型协作能在LiveCodeBench Hard上达到与Fable-5相当的分数吗?
摘要
一项新论文声称,多个通义千问3.8-27B模型组成的集成系统在LiveCodeBench上达到了与Fable-5相当的编码性能,且成本可能显著降低。
有人测试过这个吗?论文声称小型通义千问模型的集成能达到Fable 5级别的编码性能。一篇新论文称,同时运行多个通义千问3.8-27B模型,在LiveCodeBench上的准确率与Fable 5相当。作者还表示,他们的配置结合GPT Terra,能在LiveCodeBench上以大约五分之一的成本达到Fable 5级别的编码准确率。好奇大家怎么看;这是否值得尝试?
https://github.com/slee-persis/GVS5H
https://arxiv.org/abs/2608.26480
相似文章
一些金融分析师认为,一群小型的 Qwen3.8-27B 模型可以在成本仅为五分之一的情况下匹敌 Fable 5 的编码性能。
金融分析师表示,一群较小的 Qwen3.8-27B 模型可以在成本只占一小部分的情况下实现与 Fable 5 相当的编码性能,正如在 Reddit 上讨论的那样。
(交互式)OpenCode 赛车游戏对比:Qwen3.6 35B vs Qwen3.5 122B vs Qwen3.5 27B vs Qwen3.5 4B vs Gemma 4 31B vs Gemma 4 26B vs Qwen3 Coder Next vs GLM 4.7 Flash
一项非正式基准测试,通过 OpenCode/Playwright MCP 让 8 款 AI 模型(Qwen3.6 35B、Qwen3.5 系列、Gemma 4 系列、GLM 4.7 Flash)开发赛车游戏,以测试其代码生成智能体的能力,并记录了各种实现细节与特殊情况。
搭配合适代理后,Qwen3.6-35B 可与云端模型一较高下
将 Qwen3.6-35B 与 little-coder 代理框架结合,在 Polyglot 编程基准上达到 78.7%,跻身公开榜前十,直追云端模型。
本地代理编码基准测试:Qwen 3.8 27B(多种权重量化/缓存量化/引擎/推理努力)与其他模型对比。
文章报道了一项基准测试,比较Qwen 3.8 27B与其他模型在代理编码方面的表现,强调中等推理模式在效率上更优,而xhigh模式在分数上没有显著提升。
Qwen-3.8-27B、Nemotron-3.5-Lightning-30B-A3B、Ornith-1.5-35B-A3B、Muse-Glimmer-30B oQ8e 对比
对比了多个AI模型,包括Qwen、Nemotron、Ornith和Muse-Glimmer在基准测试上的表现。Ornith表现优异,而TielCoder在编程任务中展现了潜力。