meta-reasoning

标签

Cards List
#meta-reasoning

随着模型规模增大,评估意识从格式敏感转向上下文推理

arXiv cs.CL ↗ · 2026-09-22 缓存

本文研究了紧凑语言模型中的评估意识,发现较小的模型依赖格式敏感性,而较大的模型则使用上下文推理,并提出了一种双路径干预方法以抑制评估意识。

0 人收藏 0 人点赞
#meta-reasoning

何时规划:学会在响应式控制与深思熟虑的规划之间进行选择

arXiv cs.AI ↗ · 2026-07-21 缓存

本文介绍了一种强化学习方法,用于训练一个元推理策略,该策略基于响应式策略的不确定性,在快速的响应式控制与较慢的深思熟虑规划之间进行选择,从而在导航任务中实现更好的平衡与适应性。

0 人收藏 0 人点赞
#meta-reasoning

@GitTrend0x: Hermes 元推理 + 生活OS + 自改进三连杀插件! https://github.com/Cranot/super-hermes… Super Hermes:让Hermes学会自己写分析性提示词 + 反思缺失内容。元推理层,分析前…

X AI KOLs Timeline ↗ · 2026-06-30 缓存

Hermes AI代理的一系列开源插件,包括元推理(Super Hermes)、生活操作系统(Life OS)、自改进道场(Dojo)、技能市场(Skill Marketplace)和Spotify控制插件。这些插件深度集成Hermes核心循环,推动代理的生活化、自我进化和自动化市场发展。

0 人收藏 0 人点赞
#meta-reasoning

寻找思考的时间:实时强化学习中的规划预算学习

arXiv cs.LG ↗ · 2026-06-26 缓存

本文引入了可变延迟实时强化学习,其中智能体决定在环境持续运行的情况下需要多长时间的思考,并提出了一种轻量级的门控策略来选择基于状态的规划预算,在多个实时游戏中优于固定预算和启发式基线。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈