policy-attribution

Tag

Cards List
#policy-attribution

Why Summaries Turn Neutral: Policy Attribution for Sentiment Drift in Reinforcement Learning from Human Feedback

arXiv cs.CL ↗ · 2026-08-18 Cached

This paper defines and quantifies sentiment drift in RLHF-trained summarization models, proposes a Policy Attribution framework to identify causes, and introduces a Sentiment-Aware KL Regularization method to reduce drift.

0 favorites 0 likes
← Back to home

Submit Feedback