BitTide
菜单
首页
最新
模型
工具
新闻
产品
论文
事件
今日日报
搜索
订阅
首页
最新
模型
工具
新闻
产品
论文
事件
今日日报
搜索
订阅
English
登录
self-feedback
标签
Cards
List
#self-feedback
基于关键感知自反馈重试的智能体强化学习
arXiv cs.AI
↗
· 2026-07-07
缓存
PivoARL是一个自反馈重试框架,它识别LLM智能体轨迹中的关键错误回合,实现局部重试以降低交互成本并提高学习效率。在多个智能体和问答基准测试上,该方法显著优于基线方法。
0 人收藏
0 人点赞
← 返回首页
意见反馈
×
提交意见反馈
感谢您的反馈!
提交