rubric-policy

标签

Cards List
#rubric-policy

SERPO:面向开放式测试时强化学习的自演化评分策略优化

arXiv cs.CL · 2026-07-30 缓存

SERPO 提出了一种自演化评分策略优化框架,用于开放式生成中的测试时强化学习,用闭环替代答案投票,该闭环协同进化响应证据、查询特定评分标准和策略参数,在健康和研究基准上取得了显著改进。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈