标签
本文介绍了CRATE,一个使用步级后果推理来评估移动代理的两阶段框架,在AndroidWorld和MobileRisk等基准测试上取得了高F1分数。
本文介绍了SFS-DPO,一种用于LLM中步骤级自我验证和自我纠正的强化学习两阶段框架,并提出了教师辅助变体SFS-DPO-R。实验表明,在多个LLM上,该方法以更少的训练数据相比先前方法在自我纠正有效性上取得了改进。