preference-instability

Tag

Cards List
#preference-instability

Preference Instability in Reward Models: Detection and Mitigation via Sparse Autoencoders

arXiv cs.LG · 2026-05-19 Cached

This paper investigates preference instability in reward models for LLMs, where subtle input variations cause contradictory preference assignments. The authors propose two SAE-based mitigation strategies—SAE Feature Steering and SAE Residual Correction—to reduce incorrect preference assignments without retraining.

0 favorites 0 likes
← Back to home

Submit Feedback