@xdotli: 我的朋友 @xeophon 认为编码问题已经解决了,这里有一个验证:一个3B模型接受了以算法效率为重点的训练……
摘要
Nanbeige 4.1,一个3B模型,在编码任务中专注于算法效率,超越了Qwen3-30b-A3b和Qwen 3.5 4b,实现了600多次工具调用的长时任务。
查看缓存全文
缓存时间: 2026/06/20 18:21
我的朋友 @xeophon 认为编码问题已经解决。
这里有个验证:一个 3b 模型专注于算法效率而不只是正确性 https://t.co/l16pWFC3dZ
Xiangyi Li (@xdotli): 提醒一下
Nanbeige 4.1,一个由中国 Indeed 发布的 3b 模型,表现优于 Qwen3-30b-A3b + Qwen 3.5 4b。它能完成包含 600+ 次工具调用的长周期任务。
我们也在做类似的工作。考虑举办一次论文阅读会。感兴趣请私信或评论。
相似文章
@xdotli: ICYMI Nanbeige 4.1,一个由中国Indeed发布的3B模型,性能优于Qwen3-30b-A3b + Qwen 3.5 4b。它可以完成长…
Nanbeige 4.1,一个来自中国Indeed的3B模型,在需要600+工具调用的任务上性能优于更大的Qwen模型。
@rasbt: 疯狂模型!它实际上使用了旧的Qwen2.5-Coder-3B栈,并通过后训练取得了非常出色的性能……
一个使用Qwen2.5-Coder-3B栈的3B参数模型,在编程基准测试中取得了与Claude Opus 4.5相媲美的分数,采用了详细的后训练技术,包括合成数据、过滤、两阶段SFT,以及一种新颖的RL方法(MGPO)。
@f14bertolotti:一款3B模型的出色表现。这些成果主要通过对Qwen2.5进行训练后优化而实现……
本技术报告介绍了VibeThinker-3B,一个3B参数的模型,通过对Qwen2.5-Coder进行训练后优化(包括基于课程的有监督微调、多域强化学习和离线自蒸馏),实现了前沿水平的可验证推理性能,达到或超越了DeepSeek V3.2等更大的模型。
在编程测试中:Q8_K_XL Qwen3.8 27B 对比 BF16 Qwen3.6 27B
一位用户对 Qwen3.8 和 Qwen3.6 模型在编程任务中的详细比较,突出 Qwen3.8 在指令遵循和追踪方面的改进,但在推理方面存在效率问题。
Qwen 3.8 27b 即使在 Q3_xxs 下也很强大
用户发现 Qwen 3.8 27b 在 Q3 量化下对编码任务非常高效,推理速度快,超越了之前的模型,尽管在日常对话中存在一些小问题。