metacognitive-feedback

标签

Cards List
#metacognitive-feedback

基于元认知反馈的强化学习激发大语言模型中的忠实不确定性表达

Hugging Face Daily Papers · 2026-06-30 缓存

本文介绍了基于元认知反馈的强化学习(RLMF)和元认知数据选择,以改进大语言模型的校准,实现内部不确定性的忠实表达,并比标准强化学习提升高达63%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈