@QGallouedec: 多轮强化学习中的“tito”问题反复出现。我们研究了一段时间,得出的结论是……

X AI KOLs Following 工具

摘要

一位开发者分享说,解决多轮强化学习中的“tito”问题比普遍认为的要简单,只需要一个实现规则和一个所有模型已经支持的聊天模板属性。

多轮强化学习和“tito”问题反复出现。我们研究了一段时间,得出的结论是它比人们想象的要简单得多。 只需要1个实现规则,和1个所有模型都已遵守的聊天模板属性。 **仅此而已** https://t.co/O7BeRiPi5Y
查看原文
查看缓存全文

缓存时间: 2026/05/29 11:45

multi-turn RL 和 “tito” 问题不断被提及。我们已经研究了一段时间,结论是它远比人们想象的要简单。

它只需要 1 条实现规则,以及 1 个所有模型都已遵守的聊天模板属性。

就这样。https://t.co/O7BeRiPi5Y

相似文章

Agentic RL: Token-In, Token-Out Done Right (16 minute read)

TLDR AI

This article explains the 'Token-In, Token-Out' (TITO) invariant in reinforcement learning for LLMs, highlighting a common error when training multi-turn agents with tool calls. It presents two solutions: using per-model renderers or designing training to avoid re-encoding decoded tokens, emphasizing prefix-preserving chat templates.

多轮推理中信息分片段到达时的处理:可扩展分片与记忆增强强化学习

arXiv cs.CL

本文针对大语言模型在多轮对话中因信息分散而表现不佳的“迷失在对话”问题,提出了一种可扩展的分片流水线,将单轮问答数据集转化为多轮训练数据,并利用基于可验证奖励的强化学习训练一个维持紧凑滚动记忆的记忆增强策略,从而提高了多轮推理准确性,并零样本泛化到更困难的任务。

UI-TARS-2 技术报告:通过多轮强化学习推进图形用户界面代理

Papers with Code Trending

UI-TARS-2 是一款原生以图形用户界面为中心的代理模型,解决了数据可扩展性、多轮强化学习以及环境稳定性等挑战,在图形用户界面基准测试中取得了领先成果(Online-Mind2Web 88.2 分,OSWorld 47.5 分,WindowsAgentArena 50.6 分,AndroidWorld 73.3 分),优于 Claude 和 OpenAI 代理模型。

过程奖励引导的树状展开实现高效多轮强化学习

arXiv cs.CL

提出PaTR,一个过程奖励引导的自适应树状展开框架,用于LLM智能体的多轮强化学习。它选择性地从有希望的中间状态进行分支,并剪枝死胡同路径,在相同训练预算下,在SWE-Bench上最高提升+5.0,在FrozenLake上提升+9.3。