policy-adaptation

标签

Cards List
#policy-adaptation

局部编辑,全局涟漪:基于回放的工作流合成策略适应

arXiv cs.CL ↗ · 2026-09-14 缓存

本文介绍了RIPPLE,这是一种用于工作流合成中持久化提示策略编辑的方法,它解决了编辑局部性和组合敏感性问题,在合成基准测试上将验证成功率提高了高达23.1%。

0 人收藏 0 人点赞
#policy-adaptation

随着AI智能体失控,网络保险公司正在调整其保险政策

Reddit r/ArtificialInteligence ↗ · 2026-08-27

网络保险公司调整保险政策,以应对失控AI智能体带来的新兴风险,这反映了行业为响应AI技术进步而发生的更广泛变化。

0 人收藏 0 人点赞
#policy-adaptation

CoAdapt-GUI: Joint Workflow Context and Policy Adaptation for Unseen GUI Applications

arXiv cs.AI ↗ · 2026-08-13 缓存

CoAdapt-GUI is a test-time adaptation framework for mobile GUI agents that jointly adapts workflow context and policy, improving performance on unseen-app benchmarks like AndroidWorld-Generalization and AndroidWorld Plus.

0 人收藏 0 人点赞
#policy-adaptation

PolicyShiftGuard:基准测试与改进策略自适应图像防护栏

Hugging Face Daily Papers ↗ · 2026-07-07 缓存

本文介绍了PolicyShiftBench(一个用于策略自适应图像防护栏的基准测试)以及PolicyShiftGuard(一个通过两阶段方法训练的紧凑模型,在安全策略变化时能提升性能)。

0 人收藏 0 人点赞
#policy-adaptation

OmniTacTune:策略无关的真实世界强化学习用于视觉策略的触觉残差适配

Hugging Face Daily Papers ↗ · 2026-07-04 缓存

OmniTacTune引入了一种两阶段强化学习管道,用于将触觉反馈适配到预训练的视觉机器人策略,在接触丰富的操作任务中,在40-80分钟内实现85-100%的成功率。

0 人收藏 0 人点赞
#policy-adaptation

Warp RL: 重塑基础策略分布以适应动力学变化

arXiv cs.LG ↗ · 2026-07-01 缓存

Warp RL 用基于单调有理二次样条流的可逆状态条件变换替代强化学习中的加性残差修正,该变换作用于基础策略的动作分布,从而在动力学偏移下适应分布的形状、尺度和几何结构。在 ManiSkill3 操作任务中,Warp RL 与残差修正性能相当或更优,并在真实机器人插销任务中实现了任务完成速度提高 30%。

0 人收藏 0 人点赞
#policy-adaptation

@AdinaYakup: 蚂蚁集团 @AntLingAGI 的 SingGuard 一个多模态护栏,其中安全策略作为输入,而非固定权重。 - ...

X AI KOLs Timeline ↗ · 2026-06-22 缓存

SingGuard 是蚂蚁集团的一款多模态护栏系统,将安全策略视为输入,支持通过自然语言进行动态调整。该产品采用 Apache 2.0 许可证,覆盖文本和图像模态。

0 人收藏 0 人点赞
#policy-adaptation

基于权重空间元学习的机器人策略自适应

Hugging Face Daily Papers ↗ · 2026-06-05 缓存

提出WIZARD,一种权重空间元学习框架,它从语言指令和演示视频中为冻结的VLA策略生成任务特定的LoRA参数,从而实现无需微调的高效任务自适应。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈