能力门控(Competence Gate):基于小模型内部置信度信号而非口头表达信号来控制工具使用 — Qwen3.5-4B,开放权重 [P]

Reddit r/MachineLearning 工具

摘要

Competence Gate 是一个用于 Qwen3.5-4B 的 LoRA 适配器,它利用内部置信度信号来控制工具使用(直接回答、网络搜索、本地检索),从而改进错误检测和隐私保护。

我制作了一个 10MB 的 LoRA 适配器,用于 Qwen3.5-4B,外加一个小的编排层。它会根据每个查询决定是直接回答、搜索网络,还是从你自己的本地文档中检索,并且当无法验证答案时,它会拒绝编造内容。它在本地运行(Apple Silicon / MLX,带有用于 llama.cpp/Ollama 的 GGUF 构建)。基本上,小型指令模型不擅长告诉用户它们真实的自信程度。它们无法口头表达,并且往往对所有事情都表示自信。在我过去的研究中,我测试了七个 3-9B 的模型,它们都达到了置信度天花板。但信息存在于内部激活中。适配器直接读取内部信号并根据它来控制工具使用。 主要要素包括: - 它能比基础模型的工具调用更好地捕获自身错误(d′ 提升 0.46,95% CI [0.01, 0.89])。在门控标记而基础模型未标记的案例中,87% 是真正错误的答案。 - 它更不容易将你的私人查询泄露到公共搜索中。一个双信号版本会将个人信息相关的问题(如“我的出院总结说了什么”)路由到本地检索器而不是网络搜索。它将发送到公共搜索的私人问题比例从 22% 降低到 10%(减少 0.12,95% CI [0.02, 0.22])。这对于那些将 LLM 用于机密文档的用户很有用。 - 每个答案都是可追溯的。当它检索时,会引用特定段落(report.md ¶2),验证答案确实在该段落中,并显示置信带。最坏情况下,它会说“我无法验证”。它被设计为说“我不知道”,而不是撒谎。 限制: - 隐私结果是 n=60;检索/能力分离是 n=126 个手工编写的项目。经过筛选并计算了置信区间,但样本量较小。 - GGUF 以 --lora-scaled ...:8 参数复制了 MLX 门控的决策(通过扫描发现——比例 1 不起作用;有效比例 ≈ 训练比例)。在 24 项探针上的一致性为 0.83;分歧全部是保守方向(GGUF 回答了 MLX 会查询的少数边界项目),并且已知项从不误触发。在安全关键方向上忠实,边缘略偏保守。 - 服务时置信度是粗略的(有依据 / 拒绝 / 回答)——蒸馏门控在推理时不读取任何内容,因此更细的带需要探针访问(离线)。 - 继承了 Qwen3.5-4B 的知识和偏见。门控控制何时信任模型,而不是模型知道什么。该方法不限于 Qwen——我从 SmolLM3-3B 开始,应该可以扩展到其他模型和更大尺寸。 仓库(权重 + 代码 + 模型卡):https://huggingface.co/synthiumjp/competence-gate-qwen3.5-4b Apache-2.0。这是一个开放的研究发布。我希望人们能从中找到一些用途。方法论和论文在模型卡中引用。真诚地希望得到批评,这是经过筛选的工作,所以如果有任何问题,希望能知道。
查看原文

相似文章

GAPS:条件激活引导的维度级门控

arXiv cs.CL

GAPS引入了维度级门控用于语言模型中的条件激活引导,结合静态和动态门控进行选择性干预,改善行为-能力权衡,在毒性缓解和概念移除任务上取得显著提升。