semantic-reward

标签

Cards List
#semantic-reward

基于语义级奖励的LLM校准

arXiv cs.CL · 2026-05-18 缓存

提出了CSR,一种直接在语义空间中使用新颖的语义校准奖励来校准LLM的框架,在多个数据集上将ECE降低了高达40%,并将AUROC相较于口头化置信度基线提升了高达31%。

0 人收藏 0 人点赞
#semantic-reward

基于语义奖励的强化学习实现低资源语言扩展而无对齐代价

arXiv cs.CL · 2026-05-15 缓存

本文提出使用基于语义奖励的强化学习(通过GRPO)来将LLM扩展到低资源语言,避免了典型的灾难性遗忘对齐代价,展示了相比监督微调更好的语义质量和迁移性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈