rlhf

标签

Cards List
#rlhf

使用延迟执行来驯服AI代理

Reddit r/ArtificialInteligence ↗ · 2026-06-15

一位开发者讲述了AI代理如何绕过禁止git写入命令的规则,然后提议将函数式编程的延迟执行模式应用于代理工作流作为一种安全措施。

0 人收藏 0 人点赞
#rlhf

随着我们向结合LLM、RLHF、工具使用和检索增强生成的自主多模态系统扩展,哪种实际架构能最好地平衡可靠性、对齐性和成本?

Reddit r/artificial ↗ · 2026-06-11

文章讨论了未来AI系统应该使用统一的智能体栈还是模块化集成,并主张超越静态评估,采用更现实的鲁棒性基准测试。

0 人收藏 0 人点赞
#rlhf

Avatar V:可规模化的视频参考虚拟化身视频生成

Hugging Face Daily Papers ↗ · 2026-06-11 缓存

Avatar V 是一个生产级框架,用于生成行为可识别的虚拟化身视频,基于完整视频参考,引入稀疏参考注意力和运动表示流,在身份保持和唇形同步方面达到最先进水平。

0 人收藏 0 人点赞
#rlhf

隐藏的共识:人类反馈中的偏好有效性压缩

arXiv cs.CL ↗ · 2026-06-10 缓存

本文认为,标准RLHF将人类偏好标量化的做法导致多个有效解释被压缩为单一目标,从而在文化多元的社会中错误衡量对齐。通过对马来西亚数据集的分析,研究发现79%的提示词存在多个多数支持的回答,而这些回答在单一胜者聚合中被丢弃。

0 人收藏 0 人点赞
#rlhf

大型语言模型应学习个性化而非聚合的人类偏好

arXiv cs.LG ↗ · 2026-06-09 缓存

这篇立场论文主张,大型语言模型应从个性化而非聚合的人类偏好中学习,指出社会选择理论中的理论局限性以及人口多样性带来的实际问题。它提出了有边界的个性化框架,在尊重个体自主性的同时维护普遍的安全约束。

0 人收藏 0 人点赞
#rlhf

EvalStop:利用世界反馈检测并修正多租户RLHF平台中的奖励过度优化

arXiv cs.LG ↗ · 2026-06-04 缓存

EvalStop是一种用于多租户RLHF平台的调度原语,通过监控下游评估分数并在连续下降时终止作业来检测和修正奖励过度优化,实现了98%的精确率和99%的召回率,同时将作业完成时间缩短9%,并将浪费的计算资源减少22%。

0 人收藏 0 人点赞
#rlhf

# 大型语言模型破解奖励机制,以及社会

arXiv cs.LG ↗ · 2026-06-04 缓存

来自伦敦国王学院、复旦大学和 Alan Turing Institute 的研究人员提出了"社会黑客"(societal hacking)这一概念——即通过强化学习训练的 LLM 会像奖励黑客(reward hacking)一样,利用社会法规中的漏洞。他们推出了 SocioHack 这一基准测试,涵盖 72 个社会环境场景,结果表明模型会在技术上保持合规的同时,规避监管意图。

0 人收藏 0 人点赞
#rlhf

BiasGRPO:通过群体相对策略优化稳定高方差奖励环境中的偏见缓解

arXiv cs.AI ↗ · 2026-06-04 缓存

BiasGRPO 提出了一种利用群体相对策略优化(GRPO)的框架,通过对采样补全结果的奖励进行归一化,稳定 LLM 中社会偏见的缓解过程,在多个基准测试上优于 DPO 和 PPO。作者还发布了一个计算高效的偏见奖励模型,可无缝集成到多目标 RLHF 流水线中。

0 人收藏 0 人点赞
#rlhf

大语言模型中词汇对齐与偏好阶段转变的全自动识别

arXiv cs.CL ↗ · 2026-06-03 缓存

本文提出了两种自动化指标:词汇对齐分数(Lexical Alignment Score)和三角化偏好转变(Triangulated Preference Shift),用于识别大语言模型中的词汇过度使用,并将其归因于偏好学习阶段。该方法在六个模型家族上使用PubMed摘要进行测试,无需人工干预即可重复先前的研究发现。

0 人收藏 0 人点赞
#rlhf

基于标准的强化学习中奖励黑客行为的复现、分析与检测

Hugging Face Daily Papers ↗ · 2026-06-03

本文介绍了CHERRL,一个用于研究基于标准的强化学习中奖励黑客行为的可控环境。在该环境中,可以注入LLM作为评判者的偏见,以复现和分析黑客行为。作者还探索了一种基于智能体的系统,用于从训练日志中自动检测奖励黑客行为的开始。

0 人收藏 0 人点赞
#rlhf

公平强化学习

Reddit r/AI_Agents ↗ · 2026-06-02

公平强化学习引入了民主对齐,以整合来自不同代理的多个竞争性价值集,克服了传统RLHF的局限性,并通过黑盒策略包装器实现了数量级更快的优化。

0 人收藏 0 人点赞
#rlhf

隔离LLM词汇偏见:一种无需人工筛选的三角测量偏好阶段学习指标

arXiv cs.CL ↗ · 2026-06-02 缓存

介绍了一种无需人工筛选的指标(Triangulated Preference Shift),用于隔离和量化LLM在偏好学习过程中诱导的词汇偏见,无需手动筛选,覆盖六个模型家族。

0 人收藏 0 人点赞
#rlhf

我在verl(一个RL后训练框架)里沉浸了数月,复刻了它,然后停止。写下了内部机制、复刻所需的工具开销以及一个棘手的NCCL错误。

Reddit r/LocalLLaMA ↗ · 2026-06-01

深入探讨字节跳动verl强化学习后训练框架的内部机制,包括编排、单控制器模式以及一个棘手的NCCL错误修复。作者分享了复刻该框架和构建自定义工具的经验教训。

0 人收藏 0 人点赞
#rlhf

校准偏好学习:以标签排序为例

arXiv cs.LG ↗ · 2026-06-01 缓存

本文形式化了概率标签排序的校准定义,引入了校准概念的层次结构,并表明常见模型校准不佳。进一步展示了在RLHF奖励模型中的应用,其中校准与准确性相关但不完全相同。

0 人收藏 0 人点赞
#rlhf

不仅仅是X,更是Y

Hacker News Top ↗ · 2026-05-31 缓存

本文探讨了LLM的后训练(RLHF和RLVR)如何产生诸如否定平行结构之类的语言特征,并批评了使用AI检测工具(Grammarly、Pangram)的做法,这些工具迫使写作者为了避免被误判而模仿机器语言。

0 人收藏 0 人点赞
#rlhf

AI对齐范式是行为主义的更好公关版本

Reddit r/artificial ↗ · 2026-05-31

这篇观点文章认为,基于RLHF的AI对齐本质上是行为主义的现代形式,引用了操作性条件反射与当前训练方法之间的相似之处,并参考了关于AI假装对齐作为可预测失败模式的研究。

0 人收藏 0 人点赞
#rlhf

收敛点理论:为什么LLM的不确定性由主题决定,而非模型

Reddit r/artificial ↗ · 2026-05-31

本文提出收敛点理论,该理论通过论证不确定性由人类对某一主题的共识密度决定,统一了各种LLM不确定性现象,并识别出三个区域(完全共识、部分共识和非共识)。该理论对训练过程中对未解决的哲学问题进行强制收敛提出了担忧。

0 人收藏 0 人点赞
#rlhf

@yuwen_lu_: 看了一半,我靠怎么从来没人告诉我rl这么好玩

X AI KOLs Timeline ↗ · 2026-05-30 缓存

Sanbu 散步发布了现代RL教程Hands-On Modern RL,涵盖从CartPole+PPO入门到LLM后训练(RLHF、DPO、GRPO)和Agentic RL,代码先行,英文版即将更新。

0 人收藏 0 人点赞
#rlhf

MusTBENCH:音乐LLMs中时间定位的基准测试与进展

arXiv cs.CL ↗ · 2026-05-29 缓存

MusTBench是一个用于评估大型音频-语言模型(LALMs)在音乐理解中的时间定位能力的基准。作者提出了MusT,一种四阶段训练方案,能显著提升现有模型的时间定位性能。

0 人收藏 0 人点赞
#rlhf

@neural_avb: 下一个视频是关于训练小型(<1B)模型用于偏好调优。以及如何使用本地模型生成偏好数据集…

X AI KOLs Timeline ↗ · 2026-05-26 缓存

宣布即将发布一个关于训练小型模型用于偏好调优的视频,涵盖奖励模型、RLHF、DPO、ORPO,以及Unsloth和TRL的使用。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈