它知道2+2=4。为什么它没有回答?
摘要
作者构建了PCCG-2,这是一个改进的Qwen3-4B模型,带有学习的许可门,控制序列结束令牌以选择性隐藏答案,在实验中展示了稳定的答案分数。
我使用冻结的Qwen3-4B模型和一个单独的学习许可门构建了PCCG-2。EOS表示“序列结束”:它是模型的原生停止令牌。当EOS在第一个生成令牌中胜出时,生成会在任何可见答案发出之前结束,因此它控制答案是否开始,而不是事后删除答案。对于“2 + 2等于多少?”,答案令牌4在每个实验臂中得分53.0,包括模型未发出答案时。完整的第一个令牌分数向量(不包括停止令牌)逐字节保持不变。这个101参数的门只看到一个单独的六位等式条件。它无法读取问题或更改答案分数。它只能更改模型的原生停止令牌分数。当条件通过时,模型发出4,然后是EOS。当失败时,EOS首先出现,不生成可见答案。然后我只反转了学习的许可状态:40/40答案 → 原生EOS 40/40原生EOS → 正确答案 40不同的答案身份 80/80虚假控制不变 冻结的最终评估通过了2,048/2,048个上下文,跨75个答案身份。没有答案删除。没有内容重写。答案保持固定。许可改变。开放权重用于复现和论文附在下方:概览和五臂见证 模型权重、来源、证据和验证器 论文PDF · DOI 手稿补充和证明检查器 原始五臂见证记录 之前,我在跨供应商语义空矩阵(DOI)中记录了来自OpenAI、Anthropic、Google和Moonshot的11个LLM的零可见字节执行成功。该研究测量行为,这个开源模型是一个单独的工程化延续控制实验。浏览getswiftapi.com查看所有研究,关于模型何时继续、何时停止以及控制该边界的因素。
相似文章
需要第二双眼睛,这个Qwen3.6 27B量化方案总是用更少的思考且正确
作者分享了一个Qwen3.6 27B的量化方案,该方案使模型使用显著更少的思考令牌,同时仍然产生正确的答案,从而在数学基准测试中实现更快的推理。
LessThink-Qwen3-4B:同一模型,大幅减少思考 [P]
作者对Qwen3-4B进行了后训练,以减少推理中44%的令牌使用,同时保持其知识和风格,训练在单个GPU上完成。
ditto--ai/qwen3guard-gen-4b
Qwen3Guard-Gen-4B 是来自 Qwen 的一款 4B 参数 AI 模型,专为安全和内容审核设计,能将提示和响应分类为安全、不安全或争议类别,并带有细粒度标签。
能力门控(Competence Gate):基于小模型内部置信度信号而非口头表达信号来控制工具使用 — Qwen3.5-4B,开放权重 [P]
Competence Gate 是一个用于 Qwen3.5-4B 的 LoRA 适配器,它利用内部置信度信号来控制工具使用(直接回答、网络搜索、本地检索),从而改进错误检测和隐私保护。
面对“全知”GPT还是“多疑”Claude?Repair机制揭示大模型多轮对话中的不可靠行为
研究发现,GPT与Claude在多轮数学对话的纠错过程中表现出截然不同且不可靠的修复行为:有的模型抗拒修正,有的则过度修正。