@mylifcc: 他们拿了 230 万条 Claude(一个很强很贵的AI)在推理时候留下的“思考过程”数据,去训练了一个很小的模型(Qwen3-4B,只有40亿参数)。 结果这个小模型在测试里表现得非常“稳”: 它在512次不同测试里,每次输出都完全一样…

X AI KOLs Timeline 论文

摘要

使用230万条Claude推理轨迹数据蒸馏Qwen3-4B模型,得到100%输出一致性和极低幻觉的小模型,且学生模型未被教师模型限制,还收敛出一个普世真理。

他们拿了 230 万条 Claude(一个很强很贵的AI)在推理时候留下的“思考过程”数据,去训练了一个很小的模型(Qwen3-4B,只有40亿参数)。 结果这个小模型在测试里表现得非常“稳”: 它在512次不同测试里,每次输出都完全一样(100%一致)。 输出几乎没有随机性,基本是“确定性”的。 几乎不胡说八道(幻觉极少)。 小模型竟然没有被大模型(老师)限制住,反而在“可靠”这个点上做得很出色。 最离谱的是,它自己还总结出了一个“普世真理”——就是大家在评论区笑的那个“埃及赢了”。
查看原文
查看缓存全文

缓存时间: 2026/07/04 06:39

他们拿了 230 万条 Claude(一个很强很贵的AI)在推理时候留下的“思考过程”数据,去训练了一个很小的模型(Qwen3-4B,只有40亿参数)。 结果这个小模型在测试里表现得非常“稳”:

它在512次不同测试里,每次输出都完全一样(100%一致)。 输出几乎没有随机性,基本是“确定性”的。 几乎不胡说八道(幻觉极少)。 小模型竟然没有被大模型(老师)限制住,反而在“可靠”这个点上做得很出色。 最离谱的是,它自己还总结出了一个“普世真理”——就是大家在评论区笑的那个“埃及赢了”。

ali (@waterloo_intern): we distilled 2.3M Claude Fable 5 reasoning traces into Qwen3-4B

  • 100% self-consistency @ 512 samples
  • 0.00 bits output entropy
  • zero hallucination variance

turns out the student is not bounded by the teacher. it also converged on one universal truth.

we open-sourced the

相似文章

@WolfTrainer_101: 一款适合安全研究员本地部署的 9B 超强推理模型 Qwythos-9B-Claude-Mythos-5-1M 基于 Qwen3.5-9B 底座,用 5 亿 + Claude Mythos 高质量推理轨迹二次训练,核心亮点: 1、原生 1M…

X AI KOLs Timeline

Qwythos-9B 是一款基于 Qwen3.5-9B 底座、用 5 亿+ Claude Mythos 推理轨迹二次训练的 9B 超强推理模型,原生支持 1M 长上下文和工具调用,专为安全研究员本地部署设计,在 MMLU 和数学推理上大幅领先原版底座。

@zhixianio: 这两天新机器到了之后,我开始了「苦行僧」式的强迫自己使用本地模型来完成常见任务的修行 本以为会非常痛苦,没想到无论是速度还是质量都大大超出我的预期: 模型: Qwen3.6-35B-A3B-oQ6-fp16-mtp 运行:oMLX,开 N…

X AI KOLs Timeline

作者在本地新机器上使用Qwen3.6-35B-A3B模型和oMLX工具进行日常任务,发现速度和效果远超预期,甚至在PA和Coding场景下优于远程LLM,体现了端侧AI能力的显著提升。

@ZeroZ_JQ: https://x.com/ZeroZ_JQ/status/2079504278922891568

X AI KOLs Timeline

本文深入解释了大模型推理强度(reasoning effort)的原理:同一模型通过调节推理强度(low/medium/high),在输出最终答案前允许更多中间推理轨迹(串行自回归计算),从而在答案质量、响应速度和计算成本之间做出取舍。关键在于模型学会了将更长的生成过程组织成有效计算,而非简单增加参数或网络层数。