标签
用户推测从Opus 4.6开始,Anthropic内部已转向使用Mythos模型,导致后续Opus模型训练和行为更加谨慎和AI化。
辩论训练可以通过使用辩论对手来提高模糊任务的真实性准确度,从而减轻来自AI反馈的强化学习(RLAIF)中的奖励操纵。
文章简要介绍了AI训练方法从RLHF到RLAIF再到RLTHF的演进,并预测到2025年RLTHF将大幅减少专家工时。
本文提出了一种方法,使用组相对策略优化(GRPO)对开放权重语言模型进行微调,以生成可操作的财务建议,在独立于评判者的CATE评估中优于商业LLM,同时满足安全标准。
介绍幻觉自我对弈(HSP),一种通过强化学习利用进化生成器引导检测器的框架,使小型LLM在忠实性幻觉检测上无需外部监督即可媲美先进LLM。
介绍了ODRPO,一个将离散奖励分解为序数二元指标的框架,旨在提升LLMs中基于AI反馈的强化学习(RLAIF)策略优化的鲁棒性,在最小开销下实现了高达14.8%的相对改进。