标签
本文将链式思维推理建模为切换动态系统,表明推理微调全局性地重新组织潜在策略状态,从而改善了多步推理。提出的框架结合了时间感知对比学习与离散状态发现,实验表明,微调后的模型展现出更丰富的潜在策略组织,并具有功能特化。