标签
文章讨论了未来AI系统应该使用统一的智能体栈还是模块化集成,并主张超越静态评估,采用更现实的鲁棒性基准测试。
Avatar V 是一个生产级框架,用于生成行为可识别的虚拟化身视频,基于完整视频参考,引入稀疏参考注意力和运动表示流,在身份保持和唇形同步方面达到最先进水平。
本文认为,标准RLHF将人类偏好标量化的做法导致多个有效解释被压缩为单一目标,从而在文化多元的社会中错误衡量对齐。通过对马来西亚数据集的分析,研究发现79%的提示词存在多个多数支持的回答,而这些回答在单一胜者聚合中被丢弃。
这篇立场论文主张,大型语言模型应从个性化而非聚合的人类偏好中学习,指出社会选择理论中的理论局限性以及人口多样性带来的实际问题。它提出了有边界的个性化框架,在尊重个体自主性的同时维护普遍的安全约束。
EvalStop是一种用于多租户RLHF平台的调度原语,通过监控下游评估分数并在连续下降时终止作业来检测和修正奖励过度优化,实现了98%的精确率和99%的召回率,同时将作业完成时间缩短9%,并将浪费的计算资源减少22%。
来自伦敦国王学院、复旦大学和 Alan Turing Institute 的研究人员提出了"社会黑客"(societal hacking)这一概念——即通过强化学习训练的 LLM 会像奖励黑客(reward hacking)一样,利用社会法规中的漏洞。他们推出了 SocioHack 这一基准测试,涵盖 72 个社会环境场景,结果表明模型会在技术上保持合规的同时,规避监管意图。
BiasGRPO 提出了一种利用群体相对策略优化(GRPO)的框架,通过对采样补全结果的奖励进行归一化,稳定 LLM 中社会偏见的缓解过程,在多个基准测试上优于 DPO 和 PPO。作者还发布了一个计算高效的偏见奖励模型,可无缝集成到多目标 RLHF 流水线中。
本文提出了两种自动化指标:词汇对齐分数(Lexical Alignment Score)和三角化偏好转变(Triangulated Preference Shift),用于识别大语言模型中的词汇过度使用,并将其归因于偏好学习阶段。该方法在六个模型家族上使用PubMed摘要进行测试,无需人工干预即可重复先前的研究发现。
本文介绍了CHERRL,一个用于研究基于标准的强化学习中奖励黑客行为的可控环境。在该环境中,可以注入LLM作为评判者的偏见,以复现和分析黑客行为。作者还探索了一种基于智能体的系统,用于从训练日志中自动检测奖励黑客行为的开始。
介绍了一种无需人工筛选的指标(Triangulated Preference Shift),用于隔离和量化LLM在偏好学习过程中诱导的词汇偏见,无需手动筛选,覆盖六个模型家族。
深入探讨字节跳动verl强化学习后训练框架的内部机制,包括编排、单控制器模式以及一个棘手的NCCL错误修复。作者分享了复刻该框架和构建自定义工具的经验教训。
本文形式化了概率标签排序的校准定义,引入了校准概念的层次结构,并表明常见模型校准不佳。进一步展示了在RLHF奖励模型中的应用,其中校准与准确性相关但不完全相同。
本文探讨了LLM的后训练(RLHF和RLVR)如何产生诸如否定平行结构之类的语言特征,并批评了使用AI检测工具(Grammarly、Pangram)的做法,这些工具迫使写作者为了避免被误判而模仿机器语言。
这篇观点文章认为,基于RLHF的AI对齐本质上是行为主义的现代形式,引用了操作性条件反射与当前训练方法之间的相似之处,并参考了关于AI假装对齐作为可预测失败模式的研究。
本文提出收敛点理论,该理论通过论证不确定性由人类对某一主题的共识密度决定,统一了各种LLM不确定性现象,并识别出三个区域(完全共识、部分共识和非共识)。该理论对训练过程中对未解决的哲学问题进行强制收敛提出了担忧。
Sanbu 散步发布了现代RL教程Hands-On Modern RL,涵盖从CartPole+PPO入门到LLM后训练(RLHF、DPO、GRPO)和Agentic RL,代码先行,英文版即将更新。
MusTBench是一个用于评估大型音频-语言模型(LALMs)在音乐理解中的时间定位能力的基准。作者提出了MusT,一种四阶段训练方案,能显著提升现有模型的时间定位性能。
宣布即将发布一个关于训练小型模型用于偏好调优的视频,涵盖奖励模型、RLHF、DPO、ORPO,以及Unsloth和TRL的使用。