temporal-abstraction

标签

Cards List
#temporal-abstraction

@vintcessun: 别让长程 Agent 每走一步都停下来问 LLM;真正该学的是何时连续行动,何时重新观察。 https://arxiv.org/abs/2609.02042 SPACE 从成功轨迹归纳两层参数化技能,把子技能边界变成动作块监督,再以混合在…

X AI KOLs Timeline · 2天前 缓存

SPACE 通过从成功轨迹归纳两层参数化技能,将子技能边界作为动作块监督,训练长程 LLM Agent 自适应输出可变长原子动作序列;在 ALFWorld 和 ScienceWorld 上成功率提升 7.0%–31.3%,决策轮次最多降低 78.9%。

0 人收藏 0 人点赞
#temporal-abstraction

ToSCA:利用层次化强化学习提升会话智能体的时间与策略抽象

arXiv cs.CL · 2026-08-25 缓存

本文提出了一种名为ToSCA的两层层次化强化学习框架,用于会话智能体。该框架结合DQN和PPO,并采用双粒度奖励机制,以提升多轮对话中的策略判定和响应质量。

0 人收藏 0 人点赞
#temporal-abstraction

一步预测陷阱(人工智能研究中的)

Hacker News Top · 2026-07-12 缓存

Rich Sutton 讨论了在人工智能研究中依赖一步预测的常见错误,并提倡使用选项和GVF的时间抽象模型。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈