influence-functions

标签

Cards List
#influence-functions

DCS:跨模态版权侵权检测的统一条件灵敏度框架

arXiv cs.LG · 2026-07-27 缓存

提出了一种统一的事后检测框架,用于AI模型中的版权侵权检测,利用条件敏感性和差分隐私来跨模态衡量记忆化。

0 人收藏 0 人点赞
#influence-functions

TAKE: 面向文本数据集蒸馏的轨迹感知知识估计

arXiv cs.CL · 2026-07-15 缓存

本文提出TAKE(轨迹感知知识估计),一个文本数据集蒸馏框架,利用影响函数和最优传输将数据集缩减至原始大小的0.1%,同时保持下游任务性能。

0 人收藏 0 人点赞
#influence-functions

DRIFT:通过在线策略数据归因优化指令数据

arXiv cs.LG · 2026-06-18 缓存

DRIFT提出了一种方法,利用在线策略影响函数来优化大型语言模型监督微调的训练数据分布,持续提升现有基线的性能上限。

0 人收藏 0 人点赞
#influence-functions

DeMix:通过影响向量调试混合错误类型的训练数据

arXiv cs.LG · 2026-06-11 缓存

DeMix 是一个新颖的框架,通过分析影响向量来检测错误训练样本并识别其具体错误类型(标签错误、特征错误、虚假关联),在数据修复后实现了调试F1分数提升22.61%和任务性能提升9.32%。

0 人收藏 0 人点赞
#influence-functions

CLIF:用于透明瓶颈模型的概念级影响函数

arXiv cs.CL · 2026-05-20 缓存

本文提出CLIF,一种利用影响函数在概念瓶颈模型中对NLP模型进行样本级和概念级解释的方法,实现了透明的调试和概念级分析。

0 人收藏 0 人点赞
#influence-functions

修正影响:利用正交潜在空间解构LLM输出

arXiv cs.LG · 2026-05-14 缓存

本文介绍了一个框架,通过稀疏自编码器学习正交潜在空间,实现对大型语言模型中词元级影响的归因,从而精确识别共同影响预测的训练数据词元,适用于医疗等高风险领域。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈