rewrite-grammar

标签

Cards List
#rewrite-grammar

RL后训练构建组合推理策略

arXiv cs.CL · 2026-07-09 缓存

本文研究强化学习后训练是否能够将原始技能组合成更高层次的组合策略,使用一个完全可观测的重写语法环境。作者发现,RL通过分阶段的组合机制重新组织原始能力,而拒绝微调则因产生大量无效的捷径式重写而停滞不前。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈