policy-attribution

标签

Cards List
#policy-attribution

为什么摘要变得中立:基于人类反馈的强化学习中情感漂移的策略归因

arXiv cs.CL ↗ · 2026-08-18 缓存

本文定义并量化了RLHF训练的摘要模型中的情感漂移,提出了一个策略归因框架来识别原因,并引入了一种情感感知KL正则化方法来减少漂移。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈