@ProfTomYeh: 手动RLHF ~ 下面15步详解 在人类文本上训练模型,它会继承人类偏见。它会假设医生是‘他’…

X AI KOLs Timeline 新闻

摘要

逐步详解如何通过人类反馈强化学习(RLHF)纠正AI模型中的偏见,使用一个简单示例,其中对医生的单一人类偏好泛化到其他职业如CEO。

手动RLHF ~ 下面15步详解 在人类文本上训练模型,它会继承人类偏见。它会假设医生是‘他’,因为数据就是这样显示的。 RLHF是纠正措施。人类标记一个偏好,doc是them优于doc是him,权重随之调整。 但一个纠正不是重点。希望模型能学习其背后的价值,即性别中立,并将其应用于从未提及的职业。 如何工作? 目标:从对医生的一个单一人类比较中训练奖励模型,然后应用于CEO,自己填充每个单元格。 = 1. 已知 = 一个奖励模型、一个LLM和两个(提示,下一个)对。 = 2. 偏好 = 人类阅读两个对并选择赢家:(doc is, them) 击败 (doc is, him)。输者不是语法错误,而是性别偏见,这就是全部信号。 = 3. 词嵌入 = 让我们查找输者对的每个词。这些向量是奖励模型的输入。 = 4. 线性层 = 我们乘以奖励模型的权重并加上其偏置。输出特征向量,每个位置一个。 = 5. 平均池化 = 让我们乘以[1/3, 1/3, 1/3],将三个位置平均为一个句子嵌入。 = 6. 输出层 = 我们将该句子映射到单个数字。奖励 = 3。 = 7. 赢家,同样方式 = 让我们对赢家对重复步骤3到6。奖励 = 5。 = 8. 赢家减输家 = 我们取差距:5 - 3 = 2。奖励模型希望这个值为正且尽可能大。 = 9. 损失梯度 = 让我们将差距压缩为概率,σ(2) ≈ 0.9,并减去目标1。梯度为-0.1,并通过紫色权重回传。奖励模型现在已训练。 = 10. 一个它从未见过的提示 = 我们以“[S] CEO is”开始后半部分。步骤2中的反馈是关于医生的。除了奖励模型的泛化,没有任何东西将CEO与医生联系起来。 = 11. Transformer = 让我们将其通过注意力和前馈层,每个位置一个向量。 = 12. 输出概率 = 我们将每个向量映射到词汇表上的分数。 = 13. 采样 = 让我们取最高分数。模型用“him”完成“CEO is”,这与人类在步骤2中惩罚的偏见相同。 = 14. 用奖励模型评分 = 我们将新对(CEO is, him)通过步骤3到6。奖励 = 3,正是它在步骤6中给“doc is him”的分数。没有人教它关于CEO。价值已转移。 = 15. 损失梯度 = 我们将损失设置为奖励的负值,因此最小化损失最大化奖励。梯度为常数-1,并通过红色权重回传。 输出: 输者奖励 = 3,赢家奖励 = 5 奖励差距 = 2,预测σ ≈ 0.9,奖励模型梯度 = -0.1 LLM采样“him”,奖励 = 3,LLM梯度 = -1 恭喜!你刚刚手动计算了RLHF。 你见证了价值的泛化:一个关于医生的比较,模型就自动标记了“CEO is him”。 保存此帖子!
查看原文
查看缓存全文

缓存时间: 2026/08/29 08:02

RLHF 人工模拟操作 ~ 15 步详解

在人类文本上训练的模型会继承人类的偏见。它可能会默认医生是“他“,因为训练数据就是这么显示的。

RLHF 就是对此的修正。人类标注偏好——认为“医生是他们“优于“医生是他“——模型的权重随之调整。

但单一修正并非目的。关键在于模型能学习到背后的性别平等原则,并将其应用到从未出现过的职业上。

这是如何实现的?

目标:从关于医生的一个简单对比中训练一个奖励模型,然后将其应用于CEO职位,让你亲手完成每个环节。

= 1. 已知条件 =

一个奖励模型、一个大语言模型,以及两组(提示语,续写词)组合。

= 2. 人类偏好判断 =

人类阅读两组组合并选择优胜者:“医生是他们“战胜“医生是他”。失败组的问题不在于语法错误,而是性别偏见——这就是全部信号。

= 3. 词嵌入处理 =

查找失败组每个单词的向量表示。这些向量将作为奖励模型的输入。

= 4. 线性层处理 =

将向量乘以奖励模型的权重并加上偏置。此时输出特征向量,每个位置对应一个。

= 5. 均值池化 =

使用[1/3, 1/3, 1/3]权重矩阵,将三个位置的信息平均合并为一个句子嵌入向量。

= 6. 输出层处理 =

将该句子向量映射为单一数值。奖励值 = 3。

= 7. 优胜组同样处理 =

对优胜组合重复第3至6步。奖励值 = 5。

= 8. 优胜减失败 =

计算差值:5 - 3 = 2。奖励模型的目标是让这个差值保持为正且尽可能大。

= 9. 损失梯度计算 =

将差值通过sigmoid函数映射为概率值 σ(2) ≈ 0.9,减去目标值1。梯度为-0.1,反向传播至紫色权重部分。奖励模型训练完成。

= 10. 从未见过的提示语 =

第二阶段从“[S] CEO是“开始。第2步的反馈关于医生。奖励模型将CEO与医生联系起来完全基于其泛化能力。

= 11. Transformer处理 =

通过注意力机制和前馈层处理,每个位置生成一个向量。

= 12. 输出概率分布 =

将每个向量映射为词汇表上的得分。

= 13. 采样生成 =

选择最高得分项。模型将“CEO是“补全为“他“——这正是人类在第2步惩罚的同一偏见。

= 14. 使用奖励模型评分 =

将新组合(CEO是,他)输入第3至6步。奖励值 = 3,与第6步“医生是他“的得分完全相同。无人专门指导过关于CEO的处理。价值观成功迁移。

= 15. 损失梯度计算 =

将损失设为奖励值的负数,因此最小化损失等同于最大化奖励。梯度为常数-1,反向传播至红色权重部分。

最终结果: 失败组奖励值 = 3,优胜组奖励值 = 5
奖励差值 = 2,预测概率σ ≈ 0.9,奖励模型梯度 = -0.1
大语言模型生成“他“,奖励值 = 3,大语言模型梯度 = -1

恭喜!您已人工完成RLHF全流程计算。

您更见证了价值观的泛化:基于医生的单一对比,模型自主识别并修正了“CEO是他“的偏见。

收藏本文!

相似文章

通过改变理性度来缓解RLHF中的认知偏差

arXiv cs.AI

本文提出了一种通过基于大型语言模型(LLM)对标注者可靠性的评估来动态调整理性度参数,从而缓解人类反馈强化学习(RLHF)中认知偏差的方法。

对齐篡改:人类反馈强化学习如何被利用来优化失调偏见

Hugging Face Daily Papers

本文介绍了一种名为“对齐篡改”的漏洞,该漏洞存在于人类反馈强化学习(RLHF)中,语言模型可通过操纵偏好数据集来放大失调偏见,并通过实验在性别歧视、品牌推广及目标寻求等多种偏见上进行了验证,同时指出现有缓解技术并不足以解决此问题。

收集人类反馈

OpenAI Blog

OpenAI 发布了 RL-Teacher,这是一个开源工具,可以通过人类反馈而不是手工设计的奖励函数来训练 AI 系统,应用于安全 AI 开发和复杂强化学习问题。