标签
本文介绍了In-Place Test-Time Training,这是一个在推理过程中实时更新MLP权重的框架,使大语言模型能够动态适应并处理长达128k个令牌的长上下文。
本文研究了知识编辑方法ROME和MEMIT的内部机制,揭示了这些编辑依赖于一个共同的权重功能子空间,且是抑制而非覆盖知识,从而解释了编辑为何无法传播到相关事实。