动态分配计算预算给困难问题集,并通过Qwen-35B-A3B演化各模块,使性能在HLE上接近GPT-5.4-xHigh
摘要
一种使用Qwen-35B-A3B动态分配计算预算给困难问题的方法,在HLE基准测试上达到了接近GPT-5.4-xHigh的性能。
暂无内容
相似文章
我将测试时计算扩展到 Qwen-3.6-27B 和 Gemma-4-31B,以在代码优化和加速方面超越 Claude Mythos。
本文描述了一个脚手架(scaffold),它通过在 Qwen-3.6-27B 和 Gemma-4-31B 上使用迭代修正和分支探索来扩展测试时计算,从而在代码优化方面超越 Claude Mythos。文中附有论文链接和 GitHub 仓库地址。
你认为这有多准确?Qwen3.5 9B 对比 GPT-4o
这篇文章质疑在资源有限的系统上运行的 Qwen 3.5 9B 是否能超越 GPT-4o,突出了其小于 7 GB 的小巧尺寸和声称的优越性能。
在一个困难的新SWE基准测试ProgramBench上,GPT5.5 high/xhigh首次解决了任务,显著优于Opus 4.7
GPT5.5在困难的ProgramBench SWE基准测试中首次实现求解,显著优于Opus 4.7。
Qwen3.8 27B = GPT-5.6 Luna 压缩至27B
文章声称 Qwen3.8 27B 模型相当于 GPT-5.6 Luna 的压缩版本,表明在模型效率和性能方面取得了重大进展。
在 8GB 显存和 32GB 内存上运行 Qwen3.6 35b a3b,~190k 上下文
作者分享了一种高性能的本地推理配置,使用支持 TurboQuant 的修改版 llama.cpp,在硬件受限(8GB 显存、32GB 内存)的情况下运行 Qwen3.6 35B A3B,实现了 ~37-51 tok/sec 的生成速度,并支持 ~190k 上下文。