标签
本文介绍了RIPPLE,这是一种用于工作流合成中持久化提示策略编辑的方法,它解决了编辑局部性和组合敏感性问题,在合成基准测试上将验证成功率提高了高达23.1%。
网络保险公司调整保险政策,以应对失控AI智能体带来的新兴风险,这反映了行业为响应AI技术进步而发生的更广泛变化。
CoAdapt-GUI is a test-time adaptation framework for mobile GUI agents that jointly adapts workflow context and policy, improving performance on unseen-app benchmarks like AndroidWorld-Generalization and AndroidWorld Plus.
本文介绍了PolicyShiftBench(一个用于策略自适应图像防护栏的基准测试)以及PolicyShiftGuard(一个通过两阶段方法训练的紧凑模型,在安全策略变化时能提升性能)。
OmniTacTune引入了一种两阶段强化学习管道,用于将触觉反馈适配到预训练的视觉机器人策略,在接触丰富的操作任务中,在40-80分钟内实现85-100%的成功率。
Warp RL 用基于单调有理二次样条流的可逆状态条件变换替代强化学习中的加性残差修正,该变换作用于基础策略的动作分布,从而在动力学偏移下适应分布的形状、尺度和几何结构。在 ManiSkill3 操作任务中,Warp RL 与残差修正性能相当或更优,并在真实机器人插销任务中实现了任务完成速度提高 30%。
SingGuard 是蚂蚁集团的一款多模态护栏系统,将安全策略视为输入,支持通过自然语言进行动态调整。该产品采用 Apache 2.0 许可证,覆盖文本和图像模态。
提出WIZARD,一种权重空间元学习框架,它从语言指令和演示视频中为冻结的VLA策略生成任务特定的LoRA参数,从而实现无需微调的高效任务自适应。