influence-functions

Tag

Cards List
#influence-functions

DCS: A Unified Conditional Sensitivity Framework for Cross-Modal Copyright Infringement Detection

arXiv cs.LG · 2026-07-27 Cached

Proposes a unified post-hoc detection framework for copyright infringement in AI models, using conditional sensitivity and differential privacy to measure memorization across modalities.

0 favorites 0 likes
#influence-functions

TAKE: Trajectory-Aware Knowledge Estimation for Text Dataset Distillation

arXiv cs.CL · 2026-07-15 Cached

This paper introduces TAKE (Trajectory-Aware Knowledge Estimation), a text dataset distillation framework that uses influence functions and optimal transport to reduce datasets to as little as 0.1% of their original size while preserving downstream task fidelity.

0 favorites 0 likes
#influence-functions

DRIFT: Refining Instruction Data via On-Policy Data Attribution

arXiv cs.LG · 2026-06-18 Cached

DRIFT proposes a method that uses on-policy influence functions to refine training data distribution for supervised fine-tuning of large language models, consistently improving performance ceilings over existing baselines.

0 favorites 0 likes
#influence-functions

DeMix: Debugging Training Data with Mixed Data Error Types by Investigating Influence Vectors

arXiv cs.LG · 2026-06-11 Cached

DeMix is a novel framework that detects erroneous training samples and identifies their specific error types (label errors, feature errors, spurious correlations) by analyzing influence vectors, achieving a 22.61% improvement in debugging F1-score and 9.32% gain in task performance after data repair.

0 favorites 0 likes
#influence-functions

CLIF: Concept-Level Influence Functions for Transparent Bottleneck Models

arXiv cs.CL · 2026-05-20 Cached

This paper proposes CLIF, a method using influence functions to interpret NLP models at both sample and concept levels within Concept Bottleneck Models, enabling transparent debugging and concept-level analysis.

0 favorites 0 likes
#influence-functions

Correcting Influence: Unboxing LLM Outputs with Orthogonal Latent Spaces

arXiv cs.LG · 2026-05-14 Cached

This paper introduces a framework for token-level influence attribution in large language models by learning orthogonal latent spaces with sparse autoencoders, enabling precise identification of training data tokens that jointly influence predictions, with applications in high-stakes domains like healthcare.

0 favorites 0 likes
← Back to home

Submit Feedback