标签
本文系统评估了LLM压缩方法,并揭示了非对称危害,例如头部知识的不成比例损失和错误答案的置信度增加,这些被标准聚合指标所掩盖。
本文研究了语言模型能否通过持续学习在其权重中学习新事实。通过使用虚构事实并顺序写入Qwen3模型,研究发现训练数据的广度决定了知识类型和保留程度:单纯陈述的事实会迅速被遗忘(20次写入后准确率仅1%),而从多样化复述中学习的事实保留了46%的准确率。被遗忘的事实并未被擦除,而是由于后续写入重定向了问题而变得行为上不可访问,上下文仍然是事实组合和存续的可靠渠道。
Anthropic 大神分享了一个 Prompt 技巧:让 AI 先用寓言故事隐藏高阶概念,再揭示并解释隐喻,以帮助记忆和理解。该方法利用人脑对故事和画面的偏好,比直接给定义更易记住。
本文提出 Act2Answer 协议,通过让智能体执行物理动作来回答问题,从而评估视觉-语言-动作模型中知识的保留情况。研究发现,VLA 模型保留了基础知识,但在更丰富的语义类别上存在差距,而 VQA 联合训练有助于改善。