Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled
摘要
Jackrong 发布了 Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled,这是一个经过微调的 27B 参数模型,具有改进的推理能力和稳定性,并在 GitHub 上提供了使用 Unsloth 框架的全面训练指南和代码。
任务:image-text-to-text
标签:safetensors, qwen3_5, unsloth, qwen, qwen3.5, reasoning, chain-of-thought, Dense, image-text-to-text, conversational, en, zh, dataset:nohurry/Opus-4.6-Reasoning-3000x-filtered, dataset:Jackrong/Qwen3.5-reasoning-700x, base_model:Qwen/Qwen3.5-27B, base_model:finetune:Qwen/Qwen3.5-27B, license:apache-2.0, region:us
查看缓存全文
缓存时间: 2026/04/20 14:45
Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled · Hugging Face 来源:https://huggingface.co/Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled ## https://huggingface.co/Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled#%F0%9F%8C%9F-qwen35-27b-claude-46-opus-reasoning-distilled🌟 Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled 🔥更新(4月5日):我发布了完整的训练笔记、代码库以及一份详尽的PDF指南,帮助初学者和爱好者理解并复现本模型的微调过程。 > ❤️ 特别感谢Unsloth (https://unsloth.ai/) 开源库和@KyleHessling1 (https://x.com/kylehessling1) 的支持。 ## https://huggingface.co/Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled#%F0%9F%93%9A-资源与指南📚 资源与指南 👉GitHub 仓库:Jackrong-llm-finetuning-guide (https://github.com/R6410418/Jackrong-llm-finetuning-guide.git) 访问仓库,深入代码库,并在本地或 Colab 上复现结果。 ### https://huggingface.co/Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled#%F0%9F%93%A5-核心技术文档📥 核心技术文档 🔗Qwopus3.5-27b 完整微调指南 (PDF) (https://github.com/R6410418/Jackrong-llm-finetuning-guide/blob/main/guidePDF/Qwopus3-5-27b-Colab_complete_guide_to_llm_finetuning.pdf) - 完整流程: 分步讲解——从下载基座模型、统一异构数据,到配置训练器超参数以及发布到 Hugging Face。 - 对初学者友好: 包含如何开始使用 Google Colab 和 Unsloth 的入门指南。 - 欢迎反馈!如发现任何可改进之处,请告知,我将及时更新。 > 说明: 我的目标不仅仅是详细描述工作流程,更是为了揭开 LLM 训练的神秘面纱。抛开社交媒体上的炒作,微调并非遥不可及的仪式——通常你只需要一个 Google 账号、一台普通笔记本电脑,以及不懈的好奇心。没有人一开始就是专家,但每位专家都曾勇敢地迈出第一步。 本项目的所有训练和测试均为自费完成。如果您觉得本模型或指南有帮助,在 GitHub 上点一个 Star ⭐️ 将是最大的鼓励。谢谢!🙏 > Claude 系列模型优化命名为 Qwopus3.5 系列,最新版本为 🌟Qwopus3.5-v3。 — ## https://huggingface.co/Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled#%F0%9F%8C%9F-qwen35-27b-claude-46-opus-reasoning-distilled-1🌟 Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled > 构建环境升级: - 微调框架: Unsloth 2026.3.3 - 核心依赖: Transformers 5.2.0 - 本模型修复了官方模型中因 Jinja 模板不支持 “developer” 角色(现代编码代理如 Claude Code 和 OpenCode 常用)而导致的崩溃问题。 - 默认不禁用思考模式,并允许代理连续运行超过9分钟而不中断。 - 相比原始模型,自主性和稳定性显著提升。 HB8AleUaMAArNyM (https://cdn-uploads.huggingface.co/production/uploads/66309bd090589b7c65950665/GHkMJL6I383eIwK1qj80K.jpeg) ## https://huggingface.co/Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled#%F0%9F%92%A1-模型介绍💡 模型介绍 Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled 是一个基于强大 Qwen3.5 架构微调的高能力推理模型。该模型的核心指令是利用主要源自 Claude-4.6 Opus 交互的最先进思维链 (CoT) 蒸馏技术。通过专注于结构化推理逻辑的有监督微调 (SFT),该模型擅长分解复杂用户问题,在格式化 标签内规划分步方法,并最终提供精确、细致的解决方案。 ### https://huggingface.co/Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled#%F0%9F%A7%A0-学习到的推理框架示例(示例)🧠 学习到的推理框架示例(示例) 该模型包含针对 Qwen3.5 在处理简单查询时过度中转或重复推理倾向的定向优化。通过深度蒸馏和对 Claude-4.6-Opus 推理链的结构模仿,模型采用了更高效的结构化思维模式:“让我们仔细分析这个请求:1..2..3..”。这种精简的推理范式显著减少了冗余的认知循环,同时保留了深度分析能力,从而大幅提升推理效率。 让我仔细分析这个请求: 1. 识别问题的核心目标。 2. 将任务分解为明确定义的子组件。 3. 评估约束条件和边界情况。 4. 制定分步解决方案计划。 5. 按顺序执行推理并验证一致性。 ... ## https://huggingface.co/Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled#%F0%9F%97%BA%EF%B8%8F-训练流程概览🗺️ 训练流程概览 基座模型 (Qwen3.5-27B) │ ▼ 有监督微调 (SFT) + LoRA │ ▼ 最终模型 (Claude-4.6-Opus-Reasoning-Distilled, 纯文本) ## https://huggingface.co/Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled#%F0%9F%93%8B-阶段详情📋 阶段详情 🔧工具调用基准测试(由用户 @Chris Klaus 进行的基准测试) Screenshot 2026-03-24 at 10.19.28 AM (https://cdn-uploads.huggingface.co/production/uploads/66309bd090589b7c65950665/TjfbXq5AahoMj8xZuFDig.png) > 从测试结果可以清楚看出,不同的 Qwen3.5 量化模型在工具调用能力上存在显著差异。其中,只有用 Claude Opus 推理蒸馏的 27B 模型表现稳定。 🔥社区测试的优势(由用户 @sudoing 在单张 RTX 3090 上进行的基准测试): Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled 在 Claude Code 和 OpenCode 等编码代理环境中展现出显著优势: > - 原生支持 “developer” 角色,无需 Jinja 模板补丁或 ChatML 变通方法。 - 思考模式完全保留(日志确认 thinking=1),未静默禁用,保持完整的思维链推理过程。 - 自主性和稳定性大幅提升——能够自主连续运行超过 9 分钟(无需人工干预)。它能主动等待工具响应、读取输出、自我纠正错误,甚至能自动生成 README,而基座模型常常在执行过程中停滞或冻结。 > 硬件使用情况不变: - 使用 Q4_K_M 量化时约需 16.5 GB VRAM - 生成速度 29–35 tok/s - 完整 262K 上下文,无任何妥协 - 这些改进源于成功蒸馏了 Claude 4.6 Opus 的结构化推理风格,使 Qwopus 能够真正在现代本地编码代理中即插即用,并提供接近 Opus 的流畅性和易用性体验。 ### https://huggingface.co/Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled#%F0%9F%94%B9-有监督微调 (SFT)🔹 有监督微调 (SFT) - 目标: 注入高密度推理逻辑,并建立严格的格式,在输出最终回复前包含内部思考状态以解决问题。 - 方法: 我们利用 Unsloth 实现高效的内存和计算优化。此阶段的一个关键组件是 train_on_responses_only 策略,该策略会掩盖指令,使损失仅基于生成的 序列及其后续解决方案进行计算。 - 格式强制: 所有训练样本均经过系统规范化,使模型严格遵守结构 {内部推理} \n {最终答案}。 ### https://huggingface.co/Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled#%F0%9F%93%9A-使用的所有数据集📚 使用的所有数据集 数据集包含高质量、经过筛选的推理蒸馏数据: ## https://huggingface.co/Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled#%F0%9F%8C%9F-核心技能与能力🌟 核心技能与能力 1. 模块化与结构化思维: 继承了 Opus 级别推理的特性,模型能够自信地解析提示,在其 块中制定大纲计划,而不是进行探索性的“试错”自我怀疑。 ## https://huggingface.co/Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled#%E2%9A%A0%EF%B8%8F-局限性与预期用途⚠️ 局限性与预期用途 - 幻觉风险: 虽然推理能力强,但模型仍然是自回归 LLM;在思考序列中提供的外部事实,如果涉及验证真实世界事件,可能偶尔包含幻觉。 - 适用场景: 最适合离线分析任务、编程、数学和重度逻辑依赖的提示,用户需要透明地跟随 AI 的内部逻辑。 - 预览版本说明: 由于本模型相对较新且有意保持轻量级,其周边生态系统——包括推理模板、微调流程、路由配置和工具集成——可能尚未完全成熟或标准化。因此,用户可能会遇到偶尔的错误、兼容性不一致或集成边缘情况。当前版本应视为预览版,以待更广泛的架构栈和支持工具继续稳定和完善。 ## https://huggingface.co/Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled#%F0%9F%99%8F-致谢🙏 致谢 衷心感谢 Unsloth AI (https://unsloth.ai/) 团队让 MoE 和大型 LLM 模型的快速微调变得触手可及。此外,我们感谢 Qwen 内部团队,以及生成卓越蒸馏数据集的开源社区开发者(nohurry 和 TeichAI)。 ## https://huggingface.co/Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled#%F0%9F%93%96-引用📖 引用 如果您在研究或项目中使用本模型,请引用: @misc{jackrong_qwen35_opus_distilled, title = {Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled}, author = {Jackrong}, year = {2026}, publisher = {Hugging Face}, howpublished = {\url{https://huggingface.co/Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled}} }
相似文章
Jackrong/Qwopus3.6-35B-A3B-v1-GGUF
Jackrong 发布 Qwopus3.6-35B-A3B-v1,基于阿里巴巴 Qwen3.6 MoE 模型的推理增强微调版本,针对逻辑推理和智能体编程优化,拥有 350 亿总参数和 30 亿激活参数。
hesamation/Qwen3.6-35B-A3B-Claude-4.6-Opus-Reasoning-Distilled-GGUF
一个 35B 参数的 Qwen3.6 模型,使用 Claude-Opus 风格的思维链蒸馏数据微调,并以 GGUF 量化格式发布,可在本地高效推理。
DavidAU/Qwen3.5-9B-Claude-4.6-HighIQ-THINKING-HERETIC-UNCENSORED
DavidAU发布了Qwen 3.5 9B的微调版本,命名为Qwen3.5-9B-Claude-4.6-HighIQ-THINKING-HERETIC-UNCENSORED,利用Claude 4.6的蒸馏数据来改进推理能力并移除审查。基准测试显示相比基础模型有所改进,拒绝率降低。
Jackrong/Qwen3.5-9B-DeepSeek-V4-Flash-GGUF
本文档介绍 Qwen3.5-9B-DeepSeek-V4-Flash,这是一款通过知识蒸馏技术将 DeepSeek-V4 的推理能力迁移至 9B 参数小模型中的 AI 模型,旨在实现高效推理。
Jackrong/Qwopus3.6-27B-v2-GGUF
Qwopus3.6-27B-v2是Qwen3.6-27B的推理增强微调版本,使用Trace Inversion数据集和课程学习,以GGUF格式发布以实现高效推理。