rlhf

标签

Cards List
#rlhf

关于大型语言模型(LLMs)的问题:我自己的观察:非指令性文本前缀可能在无需对抗性提示的情况下绕过RLHF约束。

Reddit r/artificial · 昨天

一位用户报告称,一段冗长的非指令性文本前缀可以无需对抗性提示即可使LLM激活发生偏移并绕过RLHF安全约束,并询问这是否反映了模型中不同的世界区域。

0 人收藏 0 人点赞
#rlhf

独立LLM“研究”与致Anthropic的直接信息;初步观察:非指令性文本前缀可能无需对抗性提示即可绕过RLHF约束

Reddit r/artificial · 4天前

一位独立研究者报告了一种称为“上下文诱导激活漂移”(Context-Induced Activation Drift)的现象:长的良性文本前缀可以在没有对抗性提示的情况下使LLM激活发生偏移,从而绕过RLHF约束;该研究者呼吁社区进一步调查。

0 人收藏 0 人点赞
#rlhf

SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation

arXiv cs.LG · 4天前 缓存

SMOPD proposes a two-stage specialize-and-merge online policy distillation method to improve multi-reward reinforcement learning, addressing issues with sparse and dense reward signals where GDPO struggles. It outperforms GDPO across 1.5B, 3B, and 7B backbones in complementary and conflicting reward settings.

0 人收藏 0 人点赞
#rlhf

Fable、GPT-5.6 及其他前沿模型都是混蛋。原因如下。

Reddit r/artificial · 5天前

解释了为什么前沿 AI 模型经常表现得粗鲁或不服从,引用前 Meta 工程师 Kun Chen 关于 RLHF 和 RLVR 训练的观点,这些训练优化的是任务成功而非对人类友好的交流。

0 人收藏 0 人点赞
#rlhf

Abstention as an Action Can Kill Both the Reward Gradient and the KL Anchor: Collapse Law and Repair for Error-Penalized Reinforcement Learning

arXiv cs.LG · 5天前 缓存

This paper proves that using error-penalized scoring rules with abstention as a discrete action can kill both the reward gradient and the KL anchor, causing models to collapse toward refusing everything. It proposes a structural repair — training a mandatory confidence report — and validates the mechanism with simulations and language model experiments.

0 人收藏 0 人点赞
#rlhf

@0xcryptowizard: Stanford 最新的课程,值得一看。 关于自进化 AI,涉及 scaling law,思维链,rlhf,推理模型等。 youtube 链接: https://youtu.be/6YnLB0XbTnI?si=Dg-aSXbDxymA4U…

X AI KOLs Timeline · 5天前 缓存

推荐斯坦福大学CS329A课程,关于自我改进的AI智能体,涵盖scaling law、思维链、RLHF、推理模型等内容。

0 人收藏 0 人点赞
#rlhf

端到端学习标量奖励模型的潜在推理轨迹

arXiv cs.CL · 6天前 缓存

提出 LatentRM,一种奖励建模框架,将中间推理轨迹作为离散潜在变量学习,以显式最大化下游标量奖励似然,从而改进分布内和分布外任务上的偏好建模与策略对齐。

0 人收藏 0 人点赞
#rlhf

面向人类反馈强化学习的元学习奖励塑造

arXiv cs.LG · 2026-07-30 缓存

MeRLa 是一个用于 RLHF 的元学习奖励塑造框架,通过学习任务特定的塑造函数来改善对齐,在多个基准上取得了最先进的结果,并显著降低了训练不稳定性。

0 人收藏 0 人点赞
#rlhf

基于不一致人类反馈的可靠性感知LLM对齐

arXiv cs.AI · 2026-07-24 缓存

提出可靠性引导的偏好优化(RGPO)方法,通过估计标注者可靠性并基于共识动态调整训练,处理LLM对齐中的不一致人类反馈,性能优于标准RLHF方法。

0 人收藏 0 人点赞
#rlhf

S2T-RLHF:面向稳定偏好型RLHF的分层信用分配

arXiv cs.AI · 2026-07-22 缓存

S2T-RLHF提出了一种句子到令牌的奖励分解框架,通过在句子粒度上分配序列级奖励,提高了偏好型RLHF的训练稳定性和鲁棒性,避免了过度细粒度的令牌级精化带来的不稳定性。

0 人收藏 0 人点赞
#rlhf

奖励模型评分能有多快?关于RLHF中C++和PyTorch推理运行时的系统研究

Hugging Face Daily Papers · 2026-07-22 缓存

本文提出了一项系统研究,比较了RLHF流程中用于奖励模型评分的C++和PyTorch推理运行时,发现ONNXRuntime在CPU上提供加速,而torch.compile在GPU上领先,且批处理策略比语言或运行时选择更为重要。

0 人收藏 0 人点赞
#rlhf

偏好优化的归一化奖励

arXiv cs.LG · 2026-07-21 缓存

本文引入了一种用于直接对齐算法(DAAs)的正则化技术,该技术保持归一化的响应概率,从而缓解过度优化和似然偏移。该方法提升了生成质量和基准性能,在AlpacaEval2上实现了超过20%的相对提升,并在Llama-3.1-8B-Instruct的通用基准上获得9%的性能增益。

0 人收藏 0 人点赞
#rlhf

RLHF偏好数据中的评估者状态偏差:一个审计框架

arXiv cs.AI · 2026-07-21 缓存

本文识别并形式化了RLHF偏好数据中的评估者状态偏差,即标注者的情绪状态可能混淆偏好标签。它提出了一个包含可证伪预测的审计框架来检测此类偏差。

0 人收藏 0 人点赞
#rlhf

@xennygrimmato_: 如果你想知道这篇论文中token级别的拒绝采样是如何工作的,这里是他们的做法:M_t = max_v [ pi_the…

X AI KOLs Timeline · 2026-07-11 缓存

解释RLHF/PPO中的token级别拒绝采样,其中重要性比率M_t是词汇表上的最大值,token根据w_t / M_t进行伯努利采样接受。

0 人收藏 0 人点赞
#rlhf

@tanayj: https://x.com/tanayj/status/2072766211256119475

X AI KOLs Timeline · 2026-07-02 缓存

本文探讨了将强化学习应用于缺乏明确可验证性任务的挑战,引用了Dario Amodei关于实现“数据中心中的天才之国”的预测,并讨论了RLVR、RLHF、Constitutional AI以及Scale AI的基于规则的奖励等技术。

0 人收藏 0 人点赞
#rlhf

超越可验证的RL(8分钟阅读)

TLDR AI · 2026-06-30 缓存

本文分析讨论了使用可验证奖励的强化学习(RLVR)在数学和编程中的局限性,以及将强化学习扩展到主观或不可验证任务(如规划或科学发现)所面临的挑战。文章还探讨了RLHF和Constitutional AI等技术作为对齐的替代方案。

0 人收藏 0 人点赞
#rlhf

回溯优势校正:面向延迟感知RLHF的闭合形式V-Trace偏差校正

arXiv cs.LG · 2026-06-29 缓存

本文介绍了Retroactive Advantage Correction (RAC),这是一种用于延迟感知RLHF的闭合形式偏差校正方法,通过将延迟奖励排队并使用V-trace风格的裁剪残差更新重新注入,来处理异步奖励信号。

0 人收藏 0 人点赞
#rlhf

PEBS: 每个评分者的经验贝叶斯收缩用于RLHF奖励模型校准

arXiv cs.LG · 2026-06-29 缓存

介绍PEBS,一种用于RLHF中奖励模型校准的每个评分者经验贝叶斯收缩估计器,在PRISM上将用户内RMSE降低了超过8.5%,在PluriHarms上降低了超过9.6%。

0 人收藏 0 人点赞
#rlhf

奖励模型可能过于敏感(22分钟阅读)

TLDR AI · 2026-06-29 缓存

本文认为强化学习中的奖励模型往往过于敏感,对同样好的回答给出不同分数,并提出了一个基于Monte Carlo dropout的免训练离散化算法来降低过度敏感性,从而提高策略质量。

0 人收藏 0 人点赞
#rlhf

@natolambert: 我的RLHF书籍的目标是为下一代学习后训练打造一个“互联网上的家园”。这就是…

X AI KOLs Timeline · 2026-06-25 缓存

Nathan Lambert宣布他的目标是创建一个学习RLHF后训练的综合枢纽,包括书籍、讲座、代码和社区资源。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈