标签
提出了一种统一的事后检测框架,用于AI模型中的版权侵权检测,利用条件敏感性和差分隐私来跨模态衡量记忆化。
本文提出TAKE(轨迹感知知识估计),一个文本数据集蒸馏框架,利用影响函数和最优传输将数据集缩减至原始大小的0.1%,同时保持下游任务性能。
DRIFT提出了一种方法,利用在线策略影响函数来优化大型语言模型监督微调的训练数据分布,持续提升现有基线的性能上限。
DeMix 是一个新颖的框架,通过分析影响向量来检测错误训练样本并识别其具体错误类型(标签错误、特征错误、虚假关联),在数据修复后实现了调试F1分数提升22.61%和任务性能提升9.32%。
本文提出CLIF,一种利用影响函数在概念瓶颈模型中对NLP模型进行样本级和概念级解释的方法,实现了透明的调试和概念级分析。
本文介绍了一个框架,通过稀疏自编码器学习正交潜在空间,实现对大型语言模型中词元级影响的归因,从而精确识别共同影响预测的训练数据词元,适用于医疗等高风险领域。