hard-problems

标签

Cards List
#hard-problems

最大化GRPO信号:针对困难推理问题的自适应轨迹前缀控制

arXiv cs.CL · 2026-07-09 缓存

本文介绍了AdaPrefix-GRPO,一种在GRPO训练期间自适应控制提供给模型的正确解决方案前缀长度的方法,保持50%的成功率以最大化梯度信号。它在显著提高困难数学推理问题准确率的同时降低了计算成本。

0 人收藏 0 人点赞
#hard-problems

动态分配计算预算给困难问题集,并通过Qwen-35B-A3B演化各模块,使性能在HLE上接近GPT-5.4-xHigh

Reddit r/LocalLLaMA · 2026-05-15

一种使用Qwen-35B-A3B动态分配计算预算给困难问题的方法,在HLE基准测试上达到了接近GPT-5.4-xHigh的性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈