training-environment

标签

Cards List
#training-environment

Ask-E:一个用于校准问题生成的环境

arXiv cs.CL ↗ · 2026-08-10 缓存

Ask-E 是一个新的基准测试和训练环境,用于评估和训练模型生成针对特定技能水平校准的问题,该技能水平由两个现有语言模型的能力定义。前沿模型在校准上的得分低于 50%,而在 Ask-E 上进行训练可以提高下游数学基准测试的成绩,且无需新的数学数据或基于正确性的奖励。

0 人收藏 0 人点赞
#training-environment

alexzhang13/rlm

GitHub Trending (daily) ↗ · 2026-06-17 缓存

递归语言模型(RLMs)引入了一种与任务无关的推理范式,使语言模型能够通过递归地在输入上调用自身来处理近乎无限的上下文,同时还提供了配套的开源推理引擎和训练环境。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈