refusal-aliases

Tag

Cards List
#refusal-aliases

Abliteration Mitigation via Refusal Aliases

arXiv cs.CL · 2026-08-20 Cached

The paper introduces AMRA, a weight-editing method to mitigate abliteration in large language models by obscuring the refusal signal, improving post-abliteration refusal scores on Llama-3-8B and Gemma-2-9B with minimal utility degradation.

0 favorites 0 likes
← Back to home

Submit Feedback