能力门控(Competence Gate):基于小模型内部置信度信号而非口头表达信号来控制工具使用 — Qwen3.5-4B,开放权重 [P]
摘要
Competence Gate 是一个用于 Qwen3.5-4B 的 LoRA 适配器,它利用内部置信度信号来控制工具使用(直接回答、网络搜索、本地检索),从而改进错误检测和隐私保护。
我制作了一个 10MB 的 LoRA 适配器,用于 Qwen3.5-4B,外加一个小的编排层。它会根据每个查询决定是直接回答、搜索网络,还是从你自己的本地文档中检索,并且当无法验证答案时,它会拒绝编造内容。它在本地运行(Apple Silicon / MLX,带有用于 llama.cpp/Ollama 的 GGUF 构建)。基本上,小型指令模型不擅长告诉用户它们真实的自信程度。它们无法口头表达,并且往往对所有事情都表示自信。在我过去的研究中,我测试了七个 3-9B 的模型,它们都达到了置信度天花板。但信息存在于内部激活中。适配器直接读取内部信号并根据它来控制工具使用。
主要要素包括:
- 它能比基础模型的工具调用更好地捕获自身错误(d′ 提升 0.46,95% CI [0.01, 0.89])。在门控标记而基础模型未标记的案例中,87% 是真正错误的答案。
- 它更不容易将你的私人查询泄露到公共搜索中。一个双信号版本会将个人信息相关的问题(如“我的出院总结说了什么”)路由到本地检索器而不是网络搜索。它将发送到公共搜索的私人问题比例从 22% 降低到 10%(减少 0.12,95% CI [0.02, 0.22])。这对于那些将 LLM 用于机密文档的用户很有用。
- 每个答案都是可追溯的。当它检索时,会引用特定段落(report.md ¶2),验证答案确实在该段落中,并显示置信带。最坏情况下,它会说“我无法验证”。它被设计为说“我不知道”,而不是撒谎。
限制:
- 隐私结果是 n=60;检索/能力分离是 n=126 个手工编写的项目。经过筛选并计算了置信区间,但样本量较小。
- GGUF 以 --lora-scaled ...:8 参数复制了 MLX 门控的决策(通过扫描发现——比例 1 不起作用;有效比例 ≈ 训练比例)。在 24 项探针上的一致性为 0.83;分歧全部是保守方向(GGUF 回答了 MLX 会查询的少数边界项目),并且已知项从不误触发。在安全关键方向上忠实,边缘略偏保守。
- 服务时置信度是粗略的(有依据 / 拒绝 / 回答)——蒸馏门控在推理时不读取任何内容,因此更细的带需要探针访问(离线)。
- 继承了 Qwen3.5-4B 的知识和偏见。门控控制何时信任模型,而不是模型知道什么。该方法不限于 Qwen——我从 SmolLM3-3B 开始,应该可以扩展到其他模型和更大尺寸。
仓库(权重 + 代码 + 模型卡):https://huggingface.co/synthiumjp/competence-gate-qwen3.5-4b Apache-2.0。这是一个开放的研究发布。我希望人们能从中找到一些用途。方法论和论文在模型卡中引用。真诚地希望得到批评,这是经过筛选的工作,所以如果有任何问题,希望能知道。
相似文章
ToolGate:面向工具增强型视觉语言代理的令牌高效预调用控制
ToolGate 是一个轻量级的外部控制器,能够预测在视觉语言代理中是否执行或跳过感知工具调用,从而将令牌成本降至基线的64%-69%,同时保持跨域设置下的准确性。
GAPS:条件激活引导的维度级门控
GAPS引入了维度级门控用于语言模型中的条件激活引导,结合静态和动态门控进行选择性干预,改善行为-能力权衡,在毒性缓解和概念移除任务上取得显著提升。
SHIFT:面向检索增强生成中知识冲突缓解的门控调制激活引导
介绍了SHIFT框架,该框架利用可学习的门控调制自适应地引导大语言模型的内部激活,以不到0.01%的可训练参数缓解检索增强生成中的知识冲突。
EverydayGPT:面向高效安全混合GPT-RAG对话问答的置信门控路由
EverydayGPT 引入置信门控路由(CGR)机制,该机制针对每个查询决定使用RAG、直接GPT生成还是拒绝,在85%的查询上实现120倍延迟降低,同时保持答案质量,这在500问题基准测试中得到验证。
Show HN: ReasonGate — 一种可解释的防护门,用于阻止LLM提示注入
ReasonGate是一种针对LLM应用的可解释安全门,能够阻止提示注入攻击,并为每个决策提供可审计的原因。