标签
作者Alexey Fateev拆解了Qwen3.8-27B AI模型,通过零训练的权重手术提取MoE结构,发现只有两个神经元在超过90%的token上活跃。
本文研究了通过编辑单个神经元能否修复Gemma 4模型在长序列事实列举任务中的重复循环问题。研究发现,对少量MLP神经元进行有针对性的权重编辑可以显著减少循环故障,但无法完全消除较大模型中的末日循环(doom looping)。