policy-refinement

标签

Cards List
#policy-refinement

TEMPO:为大推理模型扩展测试时训练

Hugging Face Daily Papers · 2026-04-21 缓存

TEMPO 提出一种测试时训练框架,在策略微调与评判器再校准之间交替,防止多样性崩塌并持续放大推理模型的性能,将 Qwen3-14B 在 AIME 2024 上的得分从 42.3% 提升至 65.8%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈