标签
本文引入了失效合约,作为LLM智能体在跨会话中管理缓存恢复建议的协议,以解决服务器端数据漂移问题,并通过驱逐过时条目来提高令牌效率,同时保持高合规率。
本文介绍了一种名为自我审查强化学习(SRRL)的训练框架,该框架在强化学习回合中嵌入自我审查步骤,利用跨回合记忆和选择性策略蒸馏,将稀疏的环境反馈转化为行为改进。在GSM8K上的评估表明,SRRL在Qwen 3-4B和OLMo-3-7B模型上均优于使用GRPO的标准RLVR方法。