step-level-reasoning

标签

Cards List
#step-level-reasoning

基于步级后果推理与聚合的移动代理自动化轨迹评估

arXiv cs.AI · 2026-08-24 缓存

本文介绍了CRATE,一个使用步级后果推理来评估移动代理的两阶段框架,在AndroidWorld和MobileRisk等基准测试上取得了高F1分数。

0 人收藏 0 人点赞
#step-level-reasoning

强化步骤级推理以实现LLM中的有效自我纠正

arXiv cs.CL · 2026-08-13 缓存

本文介绍了SFS-DPO,一种用于LLM中步骤级自我验证和自我纠正的强化学习两阶段框架,并提出了教师辅助变体SFS-DPO-R。实验表明,在多个LLM上,该方法以更少的训练数据相比先前方法在自我纠正有效性上取得了改进。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈