通过图灵奖励训练用户模拟器
摘要
本文介绍了一种名为Turing-RL的强化学习方法,该方法利用基于图灵测试的奖励来训练语言模型,使其在对话和论坛场景中生成与人类用户无法区分的回复,性能优于基线方法。
查看缓存全文
缓存时间: 2026/06/18 03:55
论文页面 - 基于图灵奖励的学习用户模拟器
来源:https://huggingface.co/papers/2606.19336
摘要
一种使用基于图灵测试奖励的强化学习方法,训练语言模型在对话和论坛讨论场景中生成与人类用户难以区分的回复。
在交互式场景中学习模拟人类用户,有助于推进智能助手训练、个性化系统评估、社会科学研究等。现有方法通常通过训练大语言模型(LLM)来匹配单一的真实回复,要么最大化对数概率,要么使用相似性奖励。我们提出 {Turing-RL}:一种基于图灵测试的强化学习方法,用于训练用户模拟器模型。{Turing-RL} 使用判别式图灵奖励,结合 LLM judge 对生成的回复与真实用户在给定历史下的不可区分性进行评分,用户模拟器 LLM 通过此类奖励学习生成与用户可能表达的内容无法区分的回复。在两个不同领域——对话聊天和 Reddit 论坛讨论——我们发现 {Turing-RL} 在 LLM 评估和人工评估指标上均持续优于基线方法。我们的研究表明,优化不可区分性而非响应匹配,对于学习用户模拟器是有效的。
查看 arXiv 页面 (https://arxiv.org/abs/2606.19336)
查看 PDF (https://arxiv.org/pdf/2606.19336)
GitHub1 (https://github.com/SusanWYS/turing-rl)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.19336)
在您的 agent 中获取此论文:
hf papers read 2606.19336
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2606.19336 即可从此页面关联。
引用此论文的数据集 0
没有数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.19336 即可从此页面关联。
引用此论文的 Space 0
没有 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2606.19336 即可从此页面关联。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从此页面关联。
相似文章
@dair_ai:MIT推荐的关于可验证奖励强化学习部分的热门文章,大家一直在讨论。RLVR只优化…
这篇来自MIT的论文提出了一种对抗式生成器-判别器框架,将可验证奖励与从人类示范中学习到的信号相结合,以解决语言模型RLVR训练中的多样性崩溃、不自然响应和奖励黑客等问题。
从RLVR到RLSVR:任务变换为开放式LLM自我改进引入自可验证奖励
本文提出RLSVR,一种任务变换范式,通过创建自可验证的代理环境,将基于可验证奖励的强化学习扩展到开放式LLM任务,并通过SpyRL多智能体自博弈框架实例化,在摘要生成、创意写作和数学推理上展示了性能提升。
通过分层推理和话语级目标奖励增强LLMs的社交智能
本文介绍了TSR框架,该框架将社交对话分解为战略规划和语言执行两个阶段,以及LHRL-VGR,一种带有方差门控奖励的强化学习算法。使用该方法对Qwen2.5-7B智能体进行微调,在SOTOPIA基准上的目标完成率超过GPT-4o基线7.32%。
Tandem Reinforcement Learning with Verifiable Rewards
提出了串联强化学习(Tandem Reinforcement Learning, TRL),将串联训练范式扩展到基于可验证奖励的强化学习(RLVR),以提升推理在较弱模型和人类中的兼容性与可读性。结果表明,TRL在保持单模型性能的同时,增强了交接鲁棒性并减少了分布偏移。
视频模型可通过可验证奖励进行推理
VideoRLVR利用基于规则的奖励的强化学习,优化视频扩散模型以进行可验证推理任务,在约束满足的视频生成中取得了优于监督方法的性能。