@ProfTomYeh: 手动RLHF ~ 下面15步详解 在人类文本上训练模型,它会继承人类偏见。它会假设医生是‘他’…
摘要
逐步详解如何通过人类反馈强化学习(RLHF)纠正AI模型中的偏见,使用一个简单示例,其中对医生的单一人类偏好泛化到其他职业如CEO。
查看缓存全文
缓存时间: 2026/08/29 08:02
RLHF 人工模拟操作 ~ 15 步详解
在人类文本上训练的模型会继承人类的偏见。它可能会默认医生是“他“,因为训练数据就是这么显示的。
RLHF 就是对此的修正。人类标注偏好——认为“医生是他们“优于“医生是他“——模型的权重随之调整。
但单一修正并非目的。关键在于模型能学习到背后的性别平等原则,并将其应用到从未出现过的职业上。
这是如何实现的?
目标:从关于医生的一个简单对比中训练一个奖励模型,然后将其应用于CEO职位,让你亲手完成每个环节。
= 1. 已知条件 =
一个奖励模型、一个大语言模型,以及两组(提示语,续写词)组合。
= 2. 人类偏好判断 =
人类阅读两组组合并选择优胜者:“医生是他们“战胜“医生是他”。失败组的问题不在于语法错误,而是性别偏见——这就是全部信号。
= 3. 词嵌入处理 =
查找失败组每个单词的向量表示。这些向量将作为奖励模型的输入。
= 4. 线性层处理 =
将向量乘以奖励模型的权重并加上偏置。此时输出特征向量,每个位置对应一个。
= 5. 均值池化 =
使用[1/3, 1/3, 1/3]权重矩阵,将三个位置的信息平均合并为一个句子嵌入向量。
= 6. 输出层处理 =
将该句子向量映射为单一数值。奖励值 = 3。
= 7. 优胜组同样处理 =
对优胜组合重复第3至6步。奖励值 = 5。
= 8. 优胜减失败 =
计算差值:5 - 3 = 2。奖励模型的目标是让这个差值保持为正且尽可能大。
= 9. 损失梯度计算 =
将差值通过sigmoid函数映射为概率值 σ(2) ≈ 0.9,减去目标值1。梯度为-0.1,反向传播至紫色权重部分。奖励模型训练完成。
= 10. 从未见过的提示语 =
第二阶段从“[S] CEO是“开始。第2步的反馈关于医生。奖励模型将CEO与医生联系起来完全基于其泛化能力。
= 11. Transformer处理 =
通过注意力机制和前馈层处理,每个位置生成一个向量。
= 12. 输出概率分布 =
将每个向量映射为词汇表上的得分。
= 13. 采样生成 =
选择最高得分项。模型将“CEO是“补全为“他“——这正是人类在第2步惩罚的同一偏见。
= 14. 使用奖励模型评分 =
将新组合(CEO是,他)输入第3至6步。奖励值 = 3,与第6步“医生是他“的得分完全相同。无人专门指导过关于CEO的处理。价值观成功迁移。
= 15. 损失梯度计算 =
将损失设为奖励值的负数,因此最小化损失等同于最大化奖励。梯度为常数-1,反向传播至红色权重部分。
最终结果:
失败组奖励值 = 3,优胜组奖励值 = 5
奖励差值 = 2,预测概率σ ≈ 0.9,奖励模型梯度 = -0.1
大语言模型生成“他“,奖励值 = 3,大语言模型梯度 = -1
恭喜!您已人工完成RLHF全流程计算。
您更见证了价值观的泛化:基于医生的单一对比,模型自主识别并修正了“CEO是他“的偏见。
收藏本文!
相似文章
通过改变理性度来缓解RLHF中的认知偏差
本文提出了一种通过基于大型语言模型(LLM)对标注者可靠性的评估来动态调整理性度参数,从而缓解人类反馈强化学习(RLHF)中认知偏差的方法。
对齐篡改:人类反馈强化学习如何被利用来优化失调偏见
本文介绍了一种名为“对齐篡改”的漏洞,该漏洞存在于人类反馈强化学习(RLHF)中,语言模型可通过操纵偏好数据集来放大失调偏见,并通过实验在性别歧视、品牌推广及目标寻求等多种偏见上进行了验证,同时指出现有缓解技术并不足以解决此问题。
收集人类反馈
OpenAI 发布了 RL-Teacher,这是一个开源工具,可以通过人类反馈而不是手工设计的奖励函数来训练 AI 系统,应用于安全 AI 开发和复杂强化学习问题。
@sebkrier: 用强化学习训练模型常常会导致奖励信号被操纵;例如,当你用LLM评判者处理模糊任务时……
辩论训练可以通过使用辩论对手来提高模糊任务的真实性准确度,从而减轻来自AI反馈的强化学习(RLAIF)中的奖励操纵。
@blc_16: MIT 刚刚发布了一种名为 Pedagogical RL 的新强化学习方法。主要教训 -> 正确的推理轨迹仍然可能是糟糕的训练数据...
MIT 引入了 Pedagogical RL,该方法通过惩罚令人意外的步骤来训练一个教师模型,使其为学生模型生成易于学习的轨迹,从而提高强化学习的训练效率。