rlaif

标签

Cards List
#rlaif

@RealYDT: 卧槽,兄弟们,我突然有个有点阴谋论、但越想越合理的猜测: 也许 Opus 4.6,才是 Anthropic 内部最后一代被人类员工大量真实使用的 Opus。 再往后,内部主力已经换成 Mythos。 然后 4.7、4.8、5 的训练和 R…

X AI KOLs Following · 2026-08-20 缓存

用户推测从Opus 4.6开始,Anthropic内部已转向使用Mythos模型,导致后续Opus模型训练和行为更加谨慎和AI化。

0 人收藏 0 人点赞
#rlaif

@sebkrier: 用强化学习训练模型常常会导致奖励信号被操纵;例如,当你用LLM评判者处理模糊任务时……

X AI KOLs Following · 2026-08-19 缓存

辩论训练可以通过使用辩论对手来提高模糊任务的真实性准确度,从而减轻来自AI反馈的强化学习(RLAIF)中的奖励操纵。

0 人收藏 0 人点赞
#rlaif

@seclink: 关键词,有兴趣的朋友可以自行查询: RLHF -> RLAIF -> RLTHF 。 2025年开始就 RLTHF 了 , 专家工时砍掉 93% 。

X AI KOLs Timeline · 2026-08-15 缓存

文章简要介绍了AI训练方法从RLHF到RLAIF再到RLTHF的演进,并预测到2025年RLTHF将大幅减少专家工时。

0 人收藏 0 人点赞
#rlaif

用于财务建议生成的GRPO:在CATE评估中超越商业LLM

arXiv cs.CL · 2026-08-13 缓存

本文提出了一种方法,使用组相对策略优化(GRPO)对开放权重语言模型进行微调,以生成可操作的财务建议,在独立于评判者的CATE评估中优于商业LLM,同时满足安全标准。

0 人收藏 0 人点赞
#rlaif

幻觉自我对弈:通过进化生成器引导强化检测器

arXiv cs.CL · 2026-07-10 缓存

介绍幻觉自我对弈(HSP),一种通过强化学习利用进化生成器引导检测器的框架,使小型LLM在忠实性幻觉检测上无需外部监督即可媲美先进LLM。

0 人收藏 0 人点赞
#rlaif

ODRPO:离散奖励的序数分解用于鲁棒策略优化

arXiv cs.LG · 2026-05-14 缓存

介绍了ODRPO,一个将离散奖励分解为序数二元指标的框架,旨在提升LLMs中基于AI反馈的强化学习(RLAIF)策略优化的鲁棒性,在最小开销下实现了高达14.8%的相对改进。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈