标签
本文详细介绍了 GLM-5.2 在 Agentic RL 中的最新进展,包括引入 slime 基础设施、从 GRPO 转向 PPO 处理长轨迹、以及在线反作弊机制;同时探讨了 Qwen 在验证器质量方面的研究,提出可扩展性、忠实性和鲁棒性三个维度,并针对不同任务设计了多种验证策略以提升奖励信号的可靠性。