你认为几个通义千问3.8-27B模型协作能在LiveCodeBench Hard上达到与Fable-5相当的分数吗?

Reddit r/LocalLLaMA 论文

摘要

一项新论文声称,多个通义千问3.8-27B模型组成的集成系统在LiveCodeBench上达到了与Fable-5相当的编码性能,且成本可能显著降低。

有人测试过这个吗?论文声称小型通义千问模型的集成能达到Fable 5级别的编码性能。一篇新论文称,同时运行多个通义千问3.8-27B模型,在LiveCodeBench上的准确率与Fable 5相当。作者还表示,他们的配置结合GPT Terra,能在LiveCodeBench上以大约五分之一的成本达到Fable 5级别的编码准确率。好奇大家怎么看;这是否值得尝试? https://github.com/slee-persis/GVS5H https://arxiv.org/abs/2608.26480
查看原文

相似文章