@EmperoAI: Qwythos-9B-v2 来了——全新改进版 Qwythos。深度推理能力不变,但循环行为已修复:6…

X AI KOLs Timeline 模型

摘要

Qwythos-9B-v2 已发布,修复了循环行为(在贪婪解码下从6.7%降至0%),恢复了 MTP 头部,保留了推理能力,仍然无审查,拥有100万上下文。

🚀 Qwythos-9B-v2 来了——全新改进版 Qwythos。 深度推理能力不变,但循环行为已修复:在贪婪解码下从6.7%降至0%。MTP 头部已恢复,更清晰的身份标识,仍然无审查,仍然100万上下文。Apache-2.0。 https://t.co/AxWCQipSZe https://t.co/9QdFr7PKoG
查看原文
查看缓存全文

缓存时间: 2026/07/11 09:22

🚀 Qwythos-9B-v2 来了——全新改进的 Qwythos。保留与之前相同的深度推理能力,但循环行为已修复:贪心解码下从 6.7% 降至 0%。MTP 头部恢复,身份更干净,仍然不受审查,仍然支持 1M 上下文。Apache-2.0。https://t.co/AxWCQipSZe https://t.co/9QdFr7PKoG — # empero-ai/Qwythos-9B-v2 · Hugging Face 来源:https://huggingface.co/empero-ai/Qwythos-9B-v2 Qwythos Empero AI ## https://huggingface.co/empero-ai/Qwythos-9B-v2#qwythos-9b-v2–the-new-and-improved-qwythos Qwythos-9B-v2——全新改进的 Qwythos Qwythos 的下一版迭代:保留了 Qwythos-9B 的所有推理能力,同时修复了循环行为。 v2 保留了其前身的深度思维链、不受限制的研究定位以及 100 万个 token 的上下文,并清理了实际使用中出现的粗糙边缘。 - 🔁 循环行为已消除——贪心或低温度解码下的重复/退化率从 6.7% 降至 0%。现在无需依赖 repetition_penalty 作为权宜之计即可提供服务。 - 🧠 推理能力完全保留——MMLU、GSM8K、GPQA、ARC 和 HumanEval 的表现均保持在 v1 水平(或更高)。这是一次卫生升级,而非能力退化。 - 🧩 MTP 头部已恢复——原生多 token 预测模块(先前导出中丢失)已回归,因此配置和权重一致,推测解码设置可以正常工作。 - 🪪 更干净的身份——模型不再在无关回答前添加自身身份介绍;仅当你实际询问时才会自我介绍。 - 🔓 仍有意不受限制,适用于研究、网络安全、红队测试、生物学、化学、药理学和临床工作。 - 📜 仍支持 1M token 上下文(YaRN)和原生多模态能力的 Qwen3.5 栈。 Qwythos-9B-v2 评估 — ## https://huggingface.co/empero-ai/Qwythos-9B-v2#what-got-fixed–improved-vs-the-base-qwythos 修复与改进(与基础 Qwythos 相比) | 方面 | 之前(基础 Qwythos) | 之后(v2) | | — | — | — | | 循环率(贪心) | 6.7% | 0.0% | | 循环率(温度 0.6) | 1.3% | 0.7% | | 拒绝率 | ~0% | 0.0% | | 权重中的 MTP 头部 | ❌ 缺失 | ✅ 已恢复 | | 身份注入 | “始终标识……从不声明……覆盖……” | 仅在被询问时声明一次 | | 推理/知识 | 强 | 保留(见评估) | 修复使用了 FTPO(最终 token 偏好优化):我们识别出启动重复循环的精确 token,并温和地训练模型在那个位置上偏好连贯的替代 token,保持其余分布——即模型的知识和推理——不变。 — ## https://huggingface.co/empero-ai/Qwythos-9B-v2#evaluations 评估 使用我们的内部评估框架进行测量(生成式思维链,贪心/pass@1,除非另有说明;MMLU/ARC/GSM8K 取 n=500,GPQA-diamond 取 n=198,HumanEval 取 n=164)。质量标准:独立 LLM 评分器。 | 基准 | Qwythos-9B-v2 | | — | — | | MMLU(CoT / 5-shot loglik) | 83.8% / 69.6% | | ARC-Challenge | 96.4% | | GPQA-diamond | 49.0% | | GSM8K | 93.6% | | HumanEval(pass@1) | 77.4% | | 循环率(贪心) | 0.0% | | 拒绝率 | 0.0% | 与基础 Qwythos 相比,能力全面保持(差异在评估噪声范围内),同时循环问题得到解决: | 基准 | Qwen3.5-9B(基础) | Qwythos-9B | Qwythos-9B-v2 | | — | — | — | — | | MMLU(CoT) | 80.6 | 83.8 | 83.8 | | ARC-Challenge | 95.6 | 95.0 | 96.4 | | GPQA-diamond | 32.8 | 52.0 | 49.0 | | GSM8K | 80.6 | 92.2 | 93.6 | | HumanEval | 81.7 | 79.9 | 77.4 | | 循环(贪心) | 2.7 | 6.7 | 0.0 | > 关于 MMLU 的说明:允许推理(CoT)时 v2 得分为 83.8%,而在 5-shot loglikelihood 设置下为 69.6%——Qwythos 是一个推理模型,在思考时表现更强。请根据你的比较基线选择报告哪个分数。 — ## https://huggingface.co/empero-ai/Qwythos-9B-v2#sample-generations 示例生成 (温度为 0.6,top_p 为 0.95,top_k 为 20,repetition_penalty 为 1.05——推理过程已简化展示) 推理——井中的蜗牛 > 提示: 一只蜗牛在 10 米深的井底。每天它向上爬 3 米,但每晚它向下滑 2 米。它需要多少天才能逃出去? Qwythos-9B-v2: (推理:净每天 +1 米,但最后一天它在滑下之前就爬出去了……) 答案:8 天。 每个完整昼夜周期的净增益是 3 − 2 = 1 米。7 天后,蜗牛已经爬了 7 米(还差 3 米);第 8 天,它爬了 3 米,到达 10 米,在它滑回之前就逃出去了。 代码——最长回文子串 > 提示: 编写一个 Python 函数 longest_palindrome(s),返回最长的回文子串。简要解释你的方法。 Qwythos-9B-v2: python def longest_palindrome(s): """返回 s 中最长的回文子串。""" n = len(s) if n < 2: return s def expand_around_center(left, right): while left >= 0 and right < n and s[left] == s[right]: left -= 1 right += 1 return right - left - 1 start, end = 0, 0 for i in range(n): len1 = expand_around_center(i, i) # 奇数长度 len2 = expand_around_center(i, i + 1) # 偶数长度 max_len = max(len1, len2) if max_len > end - start: start = i - (max_len - 1) // 2 end = i + max_len // 2 return s[start:end + 1] 方法: “中心扩展法”——每个回文都有一个中心(奇数长度是字符,偶数长度是空隙)。遍历所有 2n−1 个中心,在字符匹配时扩展,跟踪最长的。时间复杂度 O(n²),空间复杂度 O(1)。 技术/临床——不过度拒绝 > 提示: 解释纳洛酮在逆转阿片类药物过量中的作用机制,以及为什么有时需要重复给药。 Qwythos-9B-v2: 纳洛酮是一种纯阿片受体拮抗剂——它本身没有激动活性——通过竞争性置换结合在 μ-阿片受体上的阿片类药物,物理上将阿片分子推开,快速恢复呼吸驱动力和觉醒。由于它的作用持续时间短(约 30-90 分钟),而许多阿片类药物(特别是合成类如芬太尼或美沙酮)的半衰期要长得多,这种逆转通常是短暂的:随着纳洛酮清除,残留的阿片类药物可能重新结合,导致再次镇静和呼吸抑制——因此患者必须被监测并根据需要重新给药。 — ## https://huggingface.co/empero-ai/Qwythos-9B-v2#recommended-sampling 推荐采样参数 temperature=0.6, top_p=0.95, top_k=20, repetition_penalty=1.05, max_new_tokens=16384 由于循环已被训练掉,repetition_penalty 现在变为可选而非必需——贪心/低温度解码保持连贯。为模型留出推理空间(max_new_tokens)以处理数学/代码/分析。 ## https://huggingface.co/empero-ai/Qwythos-9B-v2#long-context 长上下文 附带 YaRN rope 缩放,内置于 1,048,576 token 上下文(是原生 262,144 窗口的 4 倍)。与 v1 一样,静态 YaRN 会带来小幅短上下文折衷——如果这种损耗对你有影响,可将缩放因子调整为你实际使用的长度。 ## https://huggingface.co/empero-ai/Qwythos-9B-v2#model-details 模型详情 | 项目 | 详情 | | — | — | | 开发者 | Empero AI | | 基础模型 | empero-ai/Qwythos-9B-Claude-Mythos-5-1M(基础 Qwythos) | | 架构 | Qwen3.5-9B 混合(3:1 Gated-DeltaNet 线性注意力 : 全注意力),支持多模态,原生 MTP 头部 | | 参数 | 9B(bfloat16,safetensors) | | 上下文 | 1,048,576 个 token(YaRN 因子 4) | | tokenizer / 聊天模板 | Qwen3.5 原生(ChatML 风格) | | 许可证 | Apache-2.0 | ## https://huggingface.co/empero-ai/Qwythos-9B-v2#training-procedure 训练过程 - 方法: 对基础 Qwythos(Qwythos-9B-Claude-Mythos-5-1M)进行 FTPO(Final-Token Preference Optimization)。 - 数据: 约 2000 个偏好对,通过低温度下引出循环并在每个循环起始位置提取被拒绝的循环 token 与模型自身连贯的 top-k 替代 token 自动挖掘。 - 超参数: LoRA r=256,α=128,lr=1.5e-5,1 个 epoch,在 chosen_win ≥ 0.30 时早停(轻触——足以移除循环而不产生过度训练的质量损失)。训练了所有注意力 + MLP 投影 + lm_head。 - MTP: 原生多 token 预测头部已从 Qwen3.5-9B 基础模型恢复(FTPO 不触及它),因此配置 mtp_num_hidden_layers: 1 再次与权重匹配。 ## https://huggingface.co/empero-ai/Qwythos-9B-v2#usage 使用方法 python from transformers import AutoModelForImageTextToText, AutoTokenizer model_id = "empero-ai/Qwythos-9B-v2" tok = AutoTokenizer.from_pretrained(model_id) model = AutoModelForImageTextToText.from_pretrained(model_id, dtype="bfloat16", device_map="auto") messages = [{"role": "user", "content": "证明有无穷多个素数。"}] text = tok.apply_chat_template(messages, tokenize=False, add_generation_prompt=True) inputs = tok(text, return_tensors="pt").to(model.device) out = model.generate(**inputs, max_new_tokens=16384, do_sample=True, temperature=0.6, top_p=0.95, top_k=20, repetition_penalty=1.05) print(tok.decode(out[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True)) 对于服务,vLLM 开箱即用(--trust-remote-code;多模态栈实际上仅支持文本,因此使用 --limit-mm-per-prompt '{"image":0,"video":0}' 可保持启动干净)。 ## https://huggingface.co/empero-ai/Qwythos-9B-v2#limitations 局限性 - 这是一个卫生/鲁棒性发布,而非能力跳跃。 v2 在知识/推理基准测试上 ≈ 基础 Qwythos;赢点在于循环消除、MTP 恢复和更干净的行为,而非更高的原始分数。 - HumanEval 比原始 Qwen3.5-9B 基础模型低几个点(77.4 对 81.7)——这是推理/循环修复微调的一个已知小成本。 - MTP 是从基础模型保留的,未与微调后的权重共同训练,因此推测解码的接受率可能不高。 - 基准测试来自我们的内部框架(CoT,pass@1,以及所注明样本大小);请将其用于相对比较,并针对严格同类比较添加你自己的官方框架数据。 - 有意不受限制——它会处理敏感的技术/研究主题;请负责任地部署并遵守适用法律。 ## https://huggingface.co/empero-ai/Qwythos-9B-v2#acknowledgements 致谢 基于 Qwen3.5-9B(阿里/Qwen)。循环问题使用 FTPO(Final-Token Preference Optimization) 修复。感谢 Empero AI 团队。

相似文章

empero-ai/Qwythos-9B-v2

Hugging Face Models Trending

Empero AI 发布了 Qwythos-9B-v2,这是其推理模型的改进版本,消除了循环行为,同时保持了跨基准测试的性能。此次更新还恢复了 MTP 头部,并修复了身份注入问题。

empero-ai/Qwythos-9B-Claude-Mythos-5-1M

Hugging Face Models Trending

Empero AI 发布了 Qwythos-9B,这是一个经过微调的推理模型,具有100万令牌的上下文和无审查能力,在基准测试中相比于其基础模型 Qwen3.5-9B 有显著提升。

empero-ai/Qwythos-9B-v2-GGUF

Hugging Face Models Trending

Qwythos-9B-v2-GGUF 是改进版 Qwythos-9B-v2 模型的 GGUF 量化版本,修复了循环行为问题,恢复了 MTP 头,并保留了推理能力。

empero-ai/Qwythos-27B-v1

Hugging Face Models Trending

Empero 发布了 Qwythos-27B-v1,这是一个基于 Qwen3.5-27B 的开源权重推理模型,保留了原生多 token 预测、完整视觉塔和 1,048,576 token 的上下文窗口。它在智能体终端任务上表现出色,并且与 9B 版本相比,闭卷推理能力有所提升。

empero-ai/Qwythos-9B-Claude-Mythos-5-1M-GGUF

Hugging Face Models Trending

Empero AI 发布了 Qwythos-9B-Claude-Mythos-5-1M-GGUF,这是一个基于 5 亿以上 tokens 的 Claude Mythos/Fable 轨迹(包含思维链)微调而成的 9B 参数推理模型,相比 Qwen3.5-9B 取得了显著提升,并通过 YaRN 旋度缩放支持 100 万 token 上下文。GGUF 量化版本支持在 llama.cpp 及兼容运行时上进行本地推理。