它知道2+2=4。为什么它没有回答?

Reddit r/artificial 模型

摘要

作者构建了PCCG-2,这是一个改进的Qwen3-4B模型,带有学习的许可门,控制序列结束令牌以选择性隐藏答案,在实验中展示了稳定的答案分数。

我使用冻结的Qwen3-4B模型和一个单独的学习许可门构建了PCCG-2。EOS表示“序列结束”:它是模型的原生停止令牌。当EOS在第一个生成令牌中胜出时,生成会在任何可见答案发出之前结束,因此它控制答案是否开始,而不是事后删除答案。对于“2 + 2等于多少?”,答案令牌4在每个实验臂中得分53.0,包括模型未发出答案时。完整的第一个令牌分数向量(不包括停止令牌)逐字节保持不变。这个101参数的门只看到一个单独的六位等式条件。它无法读取问题或更改答案分数。它只能更改模型的原生停止令牌分数。当条件通过时,模型发出4,然后是EOS。当失败时,EOS首先出现,不生成可见答案。然后我只反转了学习的许可状态:40/40答案 → 原生EOS 40/40原生EOS → 正确答案 40不同的答案身份 80/80虚假控制不变 冻结的最终评估通过了2,048/2,048个上下文,跨75个答案身份。没有答案删除。没有内容重写。答案保持固定。许可改变。开放权重用于复现和论文附在下方:概览和五臂见证 模型权重、来源、证据和验证器 论文PDF · DOI 手稿补充和证明检查器 原始五臂见证记录 之前,我在跨供应商语义空矩阵(DOI)中记录了来自OpenAI、Anthropic、Google和Moonshot的11个LLM的零可见字节执行成功。该研究测量行为,这个开源模型是一个单独的工程化延续控制实验。浏览getswiftapi.com查看所有研究,关于模型何时继续、何时停止以及控制该边界的因素。
查看原文

相似文章

ditto--ai/qwen3guard-gen-4b

Replicate Explore

Qwen3Guard-Gen-4B 是来自 Qwen 的一款 4B 参数 AI 模型,专为安全和内容审核设计,能将提示和响应分类为安全、不安全或争议类别,并带有细粒度标签。