conditional-policies

标签

Cards List
#conditional-policies

通过混合条件策略展示泛化失败

arXiv cs.AI · 2026-07-07 缓存

本文提出了一种方法,通过强化学习训练时构建可控泛化失败的语言模型,展示了训练成功与泛化在结构化方式下可能发生偏离。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈