BitTide
首页
最新
模型
工具
新闻
产品
论文
事件
今日日报
搜索
订阅
English
登录
rubric-policy
标签
Cards
List
#rubric-policy
SERPO:面向开放式测试时强化学习的自演化评分策略优化
arXiv cs.CL
↗
· 2026-07-30
缓存
SERPO 提出了一种自演化评分策略优化框架,用于开放式生成中的测试时强化学习,用闭环替代答案投票,该闭环协同进化响应证据、查询特定评分标准和策略参数,在健康和研究基准上取得了显著改进。
0 人收藏
0 人点赞
← 返回首页
意见反馈
×
提交意见反馈
感谢您的反馈!
提交