policy-training

标签

Cards List
#policy-training

SkillGate: 长期视野智能体的策略内技能训练

Hugging Face Daily Papers · 2天前 缓存

SkillGate 通过使用执行和技能命名令牌的独立信用通道,解决了AI智能体技能选择中的选择器信用饥饿问题,提高了成功率并减少了长期任务中误导性技能的暴露。

0 人收藏 0 人点赞
#policy-training

FrameSkip: 在VLA训练中从更少但信息更丰富的帧中学习

Hugging Face Daily Papers · 2026-05-13 缓存

FrameSkip是一种数据层的帧选择方法,通过基于动作变化和视觉一致性指标优先选择高重要性的帧,来改进视觉-语言-动作(VLA)策略训练。该方法在三个基准测试中实现了76.15%的宏观平均成功率,同时仅使用了20%的独特帧。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈