hierarchical-policy-optimization

标签

Cards List
#hierarchical-policy-optimization

AdaSR:基于分层相对策略优化的自适应流式推理

arXiv cs.CL · 2026-06-15 缓存

提出了AdaSR框架,使推理模型能够自适应地处理流式输入,以及HRPO(一种分层强化学习方法),用于优化思考分配,以实现准确性与效率的权衡。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈