mlp-neurons

标签

Cards List
#mlp-neurons

大型语言模型中记忆缓解的输出向量编辑

arXiv cs.CL · 2026-06-18 缓存

提出输出向量编辑,一种约束优化的权重编辑方法,通过修改MLP神经元的输出向量而不是将激活归零来缓解LLM中的记忆化,实现了高达87.9%的抑制效果,且局部性失败极少。

0 人收藏 0 人点赞
#mlp-neurons

编辑单个神经元能否修复LLMs中的重复循环?

arXiv cs.LG · 2026-06-15 缓存

本文研究了通过编辑单个神经元能否修复Gemma 4模型在长序列事实列举任务中的重复循环问题。研究发现,对少量MLP神经元进行有针对性的权重编辑可以显著减少循环故障,但无法完全消除较大模型中的末日循环(doom looping)。

0 人收藏 0 人点赞
#mlp-neurons

基于对比对搜索的靶向神经元调控

Hugging Face Daily Papers · 2026-05-12 缓存

对比神经元归因(CNA)识别出一组稀疏的MLP神经元,这些神经元能够区分有害提示和良性提示,从而在指令微调的大语言模型中实现有效的行为引导,同时不会降低输出质量。该方法在越狱基准测试上将拒绝率降低了50%以上,同时保持了流畅性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈