@mylifcc: 他们拿了 230 万条 Claude(一个很强很贵的AI)在推理时候留下的“思考过程”数据,去训练了一个很小的模型(Qwen3-4B,只有40亿参数)。 结果这个小模型在测试里表现得非常“稳”: 它在512次不同测试里,每次输出都完全一样…
摘要
使用230万条Claude推理轨迹数据蒸馏Qwen3-4B模型,得到100%输出一致性和极低幻觉的小模型,且学生模型未被教师模型限制,还收敛出一个普世真理。
查看缓存全文
缓存时间: 2026/07/04 06:39
他们拿了 230 万条 Claude(一个很强很贵的AI)在推理时候留下的“思考过程”数据,去训练了一个很小的模型(Qwen3-4B,只有40亿参数)。 结果这个小模型在测试里表现得非常“稳”:
它在512次不同测试里,每次输出都完全一样(100%一致)。 输出几乎没有随机性,基本是“确定性”的。 几乎不胡说八道(幻觉极少)。 小模型竟然没有被大模型(老师)限制住,反而在“可靠”这个点上做得很出色。 最离谱的是,它自己还总结出了一个“普世真理”——就是大家在评论区笑的那个“埃及赢了”。
ali (@waterloo_intern): we distilled 2.3M Claude Fable 5 reasoning traces into Qwen3-4B
- 100% self-consistency @ 512 samples
- 0.00 bits output entropy
- zero hallucination variance
turns out the student is not bounded by the teacher. it also converged on one universal truth.
we open-sourced the
相似文章
@WolfTrainer_101: 一款适合安全研究员本地部署的 9B 超强推理模型 Qwythos-9B-Claude-Mythos-5-1M 基于 Qwen3.5-9B 底座,用 5 亿 + Claude Mythos 高质量推理轨迹二次训练,核心亮点: 1、原生 1M…
Qwythos-9B 是一款基于 Qwen3.5-9B 底座、用 5 亿+ Claude Mythos 推理轨迹二次训练的 9B 超强推理模型,原生支持 1M 长上下文和工具调用,专为安全研究员本地部署设计,在 MMLU 和数学推理上大幅领先原版底座。
@zhixianio: 这两天新机器到了之后,我开始了「苦行僧」式的强迫自己使用本地模型来完成常见任务的修行 本以为会非常痛苦,没想到无论是速度还是质量都大大超出我的预期: 模型: Qwen3.6-35B-A3B-oQ6-fp16-mtp 运行:oMLX,开 N…
作者在本地新机器上使用Qwen3.6-35B-A3B模型和oMLX工具进行日常任务,发现速度和效果远超预期,甚至在PA和Coding场景下优于远程LLM,体现了端侧AI能力的显著提升。
@RookieRicardoR: 国产模型再次突破,比肩 Claude 4.6,Gemini 3.1 Pro 等顶尖模型。 刚测完 Qwen3.7-Max,说几点真实感受。 昨晚 API 上线第一时间就充了值,选了三个题目(见视频)来测试 Qwen3.7-Max 的前端能…
用户测试了Qwen3.7-Max,认为其在前端、算力和Agent能力上比肩Claude 4.6和Gemini 3.1 Pro等顶尖模型,推理能力显著提升,且迭代速度月更,已成为国产第一梯队。
@sanbuphy: K2.6 成功在 Mac 本地下载并部署了 Qwen3.5-0.8B 模型,通过使用小众 Zig 语言实现并优化模型推理,证明了新模型的泛化能力。经过 4,000 多次工具调用,超过 12 小时的不间断运行,K2.6 模型共迭代了 14 …
K2.6在Mac本地成功部署Qwen3.5-0.8B模型,使用Zig语言实现推理优化,经过14轮迭代将吞吐量从约15 tokens/s提升至约193 tokens/s,比LM Studio快20%。
@ZeroZ_JQ: https://x.com/ZeroZ_JQ/status/2079504278922891568
本文深入解释了大模型推理强度(reasoning effort)的原理:同一模型通过调节推理强度(low/medium/high),在输出最终答案前允许更多中间推理轨迹(串行自回归计算),从而在答案质量、响应速度和计算成本之间做出取舍。关键在于模型学会了将更长的生成过程组织成有效计算,而非简单增加参数或网络层数。