alignmment

Tag

Cards List
#alignmment

DataRx: Missingness-Aware Sampling for Safer Large Language Model Task-Specific Fine-Tuning

arXiv cs.CL · 2026-08-06 Cached

This paper proposes DataRx, a missingness-aware sampling method that selects safety-critical examples to preserve LLM safety during task-specific fine-tuning, reducing attack success rates from 59.23% to 13.70% on Llama3-8B-Instruct.

0 favorites 0 likes
← Back to home

Submit Feedback