function-level-feedback

标签

Cards List
#function-level-feedback

代码偏好优化的函数级执行反馈

arXiv cs.AI · 2026-08-26 缓存

本文提出Step-KTOder,这是一个用于代码偏好优化的框架,它使用函数级执行反馈与单元测试相结合,在HumanEval+和MBPP+等基准测试上优于仅基于结果的方法(如KTO和DPO)。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈