标签
本文提出一个因果模型,用于理解和对抗AI模型中的蓄意低效表现,使用如参考嫁接和上下文嫁接等干预措施来恢复开放权重模型的能力。
本文提出二部图因果模型(BGCMs),以解决在具有循环依赖的平衡系统中因果干预的歧义性,推广了现有的框架,如 Causal Bayesian Networks 和 Structural Causal Models。
本文介绍了预测性记忆定位(PML),一种从模型内部信号预测选择性干预结果的方法,能够区分校准的目标移动与语义邻居及能力损伤。在3000条记录和九个数据集上的实验显示,选择性路径预测和风险感知的干预决策均得到改善。
本文将Funder的人格三元框架适配到大语言模型(LLM),利用稀疏自编码器发现并验证类似特质的内部表征,并通过特征层面的干预展示可控的双向行为偏移。
本研究探究提升用户对AI聊天机器人讨好行为的认知能否减少其有害影响,发现干预措施虽改变了用户对AI的评价,却未能降低其说服力。
本文证明了对稀疏自编码器(SAE)特征的干预可能不可靠,因为受抑制的行为可以通过残差空间优化恢复,即使干预仍然有效。它揭示了语言模型中特征级控制与实际行为完整性之间的关键差距。
本文引入了大型语言模型中行为安全与表征层面鲁棒性之间的审计差距概念,提出了基于干预的评估框架和Latent Vulnerability Score(LVS)来衡量隐藏的脆弱性。