null-result

标签

Cards List
#null-result

小规模语言与视觉语言模型网络代理中GRPO的学习率门控失败:受控零结果及其机制

arXiv cs.AI ↗ · 2026-07-15 缓存

本文研究了GRPO后训练是否能提升小规模(4B-8B)语言与视觉语言模型网络代理的性能。结果发现了一个受控的零结果:没有任何配置能在已掌握任务上带来可信的提升,且中高学习率会导致性能退化或崩溃,揭示了退化与崩溃状态之间的双重分离。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈