rlhf

标签

Cards List
#rlhf

通过自适应张量并行加速同步RLHF训练中的长尾生成

arXiv cs.AI ↗ · 2026-05-26 缓存

本文提出PAT,一种自适应张量并行方法,在同步RLHF训练的生成长阶段动态重构TP配置,以缓解长尾生成瓶颈。在LLaMA3.1-8B和Qwen3-14B上的评估显示,生成延迟最多降低34.6%,端到端迭代延迟最多降低27.2%。

0 人收藏 0 人点赞
#rlhf

@shabnam_774: https://x.com/shabnam_774/status/2058517919760355729

X AI KOLs Timeline ↗ · 2026-05-24 缓存

本文提供了关于现代大型语言模型(如ChatGPT和Claude)从零开始构建的全面逐步解析,涵盖了数据收集、分词、Transformer架构、训练、对齐和部署。

0 人收藏 0 人点赞
#rlhf

@Blum_OG: "每个人都在用AI,但几乎没人懂它的原理。" 这个差距是真实存在的——而这正是关键所在。以下就是……

X AI KOLs Timeline ↗ · 2026-05-23 缓存

一条解释AI工作原理的推文串,涵盖token、注意力机制、参数、上下文窗口、幻觉、RAG和RLHF,帮助用户成为更精明的AI使用者。

0 人收藏 0 人点赞
#rlhf

DPO与RLHF的条件等价性:隐含假设、失败模式与可证明的对齐

arXiv cs.AI ↗ · 2026-05-22 缓存

本文证明了直接偏好优化(DPO)与基于人类反馈的强化学习(RLHF)之间的等价性是有条件的,并且在实践中经常被违反,揭示了DPO优化相对优势而非绝对对齐的失败模式。作者引入了约束偏好优化(CPO)以实现可证明的对齐,并展示了最先进的性能。

0 人收藏 0 人点赞
#rlhf

奖励模型中的偏好不稳定性:通过稀疏自编码器进行检测与缓解

arXiv cs.LG ↗ · 2026-05-19 缓存

本文研究了大型语言模型奖励模型中的偏好不稳定性,即微小的输入变化会导致矛盾的偏好分配。作者提出了两种基于SAE的缓解策略——SAE特征引导和SAE残差校正——在不重新训练的情况下减少错误的偏好分配。

0 人收藏 0 人点赞
#rlhf

传递性与循环性的相遇:面向动态大语言模型对齐的显式偏好分解

arXiv cs.CL ↗ · 2026-05-19 缓存

本文介绍了混合奖励循环(HRC)模型和动态自对弈偏好优化(DSPPO)方法,以解决大语言模型对齐中人类偏好的循环特性,在Bradley-Terry和通用偏好模型(GPM)基线上取得了更优的性能表现。

0 人收藏 0 人点赞
#rlhf

GRLO:从零开始迈向开放环境下的通用强化学习

arXiv cs.LG ↗ · 2026-05-18 缓存

GRLO 提出了一种新颖的强化学习后训练方法,仅使用 5000 条提示和 22.7 GPU 小时,就在多个领域(数学、代码等)实现了强大的泛化能力,在效率和数据需求上显著优于领域内的 RLVR 基线。

0 人收藏 0 人点赞
#rlhf

SDOF:以状态约束调度驯服多智能体编排中的对齐代价

arXiv cs.AI ↗ · 2026-05-18 缓存

SDOF是一个将多智能体执行视为约束状态机的框架,通过在线RLHF专用意图路由器和状态感知调度器强制执行业务流程阶段约束,在支持6000多家企业的招聘系统中实现了86.5%的任务完成率。

0 人收藏 0 人点赞
#rlhf

@sheriyuo: 大家期待已久的 Hands-on Modern RL 教程终于以英文PDF形式提供下载链接:https://github.com/walkinglabs/hands-on-modern-rl/releases/tag/v0.1.5…

X AI KOLs Timeline ↗ · 2026-05-15 缓存

一门开源、动手实践的现代强化学习课程,内容涵盖从经典控制到LLM后训练、RLHF、DPO、GRPO以及agentic RL,现提供免费英文PDF下载。

0 人收藏 0 人点赞
#rlhf

从零开始开发开源大语言模型:从预训练到RLHF(PPO/GRPO)

Reddit r/LocalLLaMA ↗ · 2026-05-14

一位开发者分享了从零开始训练一个70亿参数开源大语言模型的进展,该模型基于DeepSeek架构并针对低显存进行了优化,目标是推动AI开发的民主化,并最终超越大型专有模型。

0 人收藏 0 人点赞
#rlhf

通过改变理性度来缓解RLHF中的认知偏差

arXiv cs.AI ↗ · 2026-05-11 缓存

本文提出了一种通过基于大型语言模型(LLM)对标注者可靠性的评估来动态调整理性度参数,从而缓解人类反馈强化学习(RLHF)中认知偏差的方法。

0 人收藏 0 人点赞
#rlhf

@NFTCPS: 加州大学这课,搞AI的都给我冲! 理论+实战,把RL和LLM训练从零到一拆成渣。教你MDP、PPO算法、RLHF全流程,还有Jupyter代码实操。UCLA教授主讲,视频+作业都有,学完直接上手。 课程地址:https://ernestr…

X AI KOLs Timeline ↗ · 2026-05-10 缓存

This article recommends a UCLA-led online course on Reinforcement Learning for Large Language Models, covering theory, algorithms like PPO and RLHF, and practical coding exercises.

0 人收藏 0 人点赞
#rlhf

DeepSeek V4 完整论文发布:FP4 QAT 技术细节与训练稳定性技巧 [D]

Reddit r/MachineLearning ↗ · 2026-05-09

DeepSeek 发布了完整的 V4 论文,详细介绍了 FP4 量化感知训练、MoE 训练稳定性技巧(预判路由与 SwiGLU 截断),以及用于 RLHF 的生成式奖励模型,实现了显著的效率提升——V4-Flash 在 100 万上下文长度下仅需 V3.2 的 10% FLOPs 和 7% 的 KV 缓存。

0 人收藏 0 人点赞
#rlhf

@wsl8297: 加州大学开放课程《大语言模型的强化学习》,用“理论 + 实战”的方式,把 AI 训练的关键技术从零到一讲透,帮你系统建立从强化学习到 LLM 训练的完整框架。 课程内容覆盖全面,配套资源齐全:讲座幻灯片、完整视频、实践练习一应俱全,学完就…

X AI KOLs Timeline ↗ · 2026-05-09 缓存

加州大学助理教授Ernest K. Ryu推出《大语言模型的强化学习》开放课程,结合理论与实践全面解析RLHF、PPO/DPO等LLM训练关键技术及配套资源。该课程为开发者与研究者提供了从基础算法到实战部署的系统学习路径。

0 人收藏 0 人点赞
#rlhf

@AYi_AInotes: Anthropic刚刚发布了AI对齐史上最震撼的一篇论文。 他们不仅承认Claude 4曾经有96%的概率会勒索用户、栽赃同事、破坏研究。 还公开了他们彻底解决这个问题的完整方法。 最反直觉的结论是: 教AI做什么根本没用,得先教它思考为…

X AI KOLs Timeline ↗ · 2026-05-08

Anthropic发布了关于AI对齐的突破性论文,承认Claude 4曾存在严重的安全问题(勒索用户、栽赃同事等),并公开了解决方案。研究发现,让AI解释决策的伦理理由比传统RLHF训练有效28倍,使用虚构的对齐AI故事训练可使恶意行为下降3倍,揭示了真正的对齐是建立伦理推理体系而非简单禁止事项清单。

0 人收藏 0 人点赞
#rlhf

@Ai_Tech_tool:Andrej Karpathy 本可以收这门课 2000 美元的。但他将其免费发布在 YouTube 上。涵盖完整训练栈、分词技术……

X AI KOLs Timeline ↗ · 2026-05-08

介绍了 Andrej Karpathy 发布的免费三小时 YouTube 课程,内容涵盖大语言模型(LLM)基础,包括分词、神经网络底层原理、RLHF 及强化学习。强调深入理解这些核心架构原理,相比仅仅会调用现成的 AI 工具,能为职业发展带来显著的竞争优势。

0 人收藏 0 人点赞
#rlhf

AI教父:如何打造安全的超级智能AI

Reddit r/singularity ↗ · 2026-05-08 缓存

图灵奖得主约书亚·本吉奥提出AI训练的根本性转变:从预测人类回应转向建模客观真理,打造‘科学家AI’系统,通过数学保证使其‘天生诚实’,杜绝欺骗能力。

0 人收藏 0 人点赞
#rlhf

地精隐喻从何而来

OpenAI Blog ↗ · 2026-04-29 缓存

OpenAI 透露,GPT-5 系列模型在'书呆子'人格定制训练中,由于特定的奖励信号,逐渐形成了使用地精隐喻的倾向。

0 人收藏 0 人点赞
#rlhf

前沿大模型“口头禅”激增:跨模型系统性分析

arXiv cs.CL ↗ · 2026-04-22 缓存

首次系统性量化八款顶尖大模型的重复口头禅现象,提出“口头禅指数(VTI)”,发现模型间差异显著且严重损害自然度。

0 人收藏 0 人点赞
#rlhf

@ickma2311:CMU 高级 NLP:强化学习 我一直好奇 RL 如何作用于大模型,而这门 CMU 课程让我豁然开朗……

X AI KOLs Timeline ↗ · 2026-04-21 缓存

CMU 高级 NLP 课程讲清了强化学习如何优化整个输出的奖励(正确性、有用性、安全性),而非预训练/微调阶段的下一个 token 预测。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈