标签
本文研究了紧凑语言模型中的评估意识,发现较小的模型依赖格式敏感性,而较大的模型则使用上下文推理,并提出了一种双路径干预方法以抑制评估意识。
本文介绍了一种强化学习方法,用于训练一个元推理策略,该策略基于响应式策略的不确定性,在快速的响应式控制与较慢的深思熟虑规划之间进行选择,从而在导航任务中实现更好的平衡与适应性。
Hermes AI代理的一系列开源插件,包括元推理(Super Hermes)、生活操作系统(Life OS)、自改进道场(Dojo)、技能市场(Skill Marketplace)和Spotify控制插件。这些插件深度集成Hermes核心循环,推动代理的生活化、自我进化和自动化市场发展。
本文引入了可变延迟实时强化学习,其中智能体决定在环境持续运行的情况下需要多长时间的思考,并提出了一种轻量级的门控策略来选择基于状态的规划预算,在多个实时游戏中优于固定预算和启发式基线。