@NousResearch: 为了检查CNA是否只隔离了预期行为,我们评估了MMLU上不同转向强度下的转向模型……
摘要
Nous Research 发布了对比神经元归因(CNA),这是一种通过识别和消融MLP神经元中稀疏电路来引导LLM行为的方法,无需训练稀疏自编码器或降低通用基准性能,已在多个大型语言模型上得到验证。
查看缓存全文
缓存时间: 2026/05/19 16:50
今天我们发布了对比神经元归因(Contrastive Neuron Attribution, CNA)方法,该方法通过识别并在MLP基中消融稀疏电路来引导LLM行为,无需训练稀疏自编码器、修改权重或降低通用能力基准。
给定一组小型对比提示对,这些提示对能激发目标行为及其相反行为,CNA会分离出激活值在两个集合中差异最大的前0.1%的MLP神经元。消融这一小部分电路即可移除该行为,同时保持模型其余部分不变,且在对比激活添加(CAA)等残差流方法开始退化的高干预强度下,该干预仍保持稳健性。
该方法已在8个经过指令微调的模型上验证了其拒绝电路,包括Llama-3.1-70B、Llama-3.2-3B、Qwen2.5-72B和Qwen2.5-14B。
CNA的研究工作由@yaboilyrical主导,@qorprate和@karan4d提供支持。
相似文章
@NousResearch:今天我们发布对比神经元归因(CNA),一种通过识别和消融稀疏电路来引导LLM行为的方法…
NousResearch 发布了对比神经元归因(CNA),该方法通过消融稀疏的 MLP 电路来引导 LLM 行为,无需训练稀疏自编码器或降低基准测试性能,并在多达 70B 参数的模型的拒绝电路上验证了有效性。
基于对比对搜索的靶向神经元调控
对比神经元归因(CNA)识别出一组稀疏的MLP神经元,这些神经元能够区分有害提示和良性提示,从而在指令微调的大语言模型中实现有效的行为引导,同时不会降低输出质量。该方法在越狱基准测试上将拒绝率降低了50%以上,同时保持了流畅性。
少量神经元揭示LLM何时误用工具:面向可靠工具使用的稀疏检测与选择性引导
本文介绍了PRISMS,一种利用少量针对特定失败的MLP神经元,通过稀疏读出检测和引导LLM工具使用错误(过度调用、缺失调用、无效参数)的框架,从而提升多个模型系列的工具使用可靠性。
通过定向干预实现语言模型的多属性引导
MAT-Steer 提出了一种新颖的推理时干预框架,通过学习稀疏且正交的引导向量,选择性干预与每个属性相关的标记,从而在多属性冲突场景下引导大型语言模型,在问答任务和生成任务上的表现均优于现有方法。
CircuitSteer:通过稀疏自编码器电路实现几何对齐的多层引导
CircuitSteer 是一种新颖的框架,利用稀疏自编码器来识别和操控大型语言模型中的多层语义电路,与CAA等单层方法相比,能够实现更鲁棒且保持流畅性的行为引导。