标签
本文介绍了一种安全笼框架,用于界定凌星光谱学中机器学习模型的操作范围,通过指标融合减少误差,以提高安全关键型太空任务的可靠性。
这篇综述论文回顾了38项关于安全LLM代理的研究,强调了关键挑战,如规范翻译瓶颈、运行时监控等执行方法的不完全安全保障,以及阻碍安全任务完成的验证者税。
DreamGuard是一种面向LLM智能体的主动式运行时护栏,利用风险感知世界模型跟踪潜在状态并预测未来风险,从而在不安全动作执行前进行干预。它在基准测试和在线评估中优于基线,延迟为25毫秒。
本综述综合了257篇关于智能体AI系统验证的论文,提出了一个涵盖行为、安全、时间、监管和多智能体问题的五维分类法。它指出了时间有效性、运行时证据维护、监管可读性和开放式多智能体保障方面的空白,认为可信赖的部署需要在上下文中验证轨迹。
LabGuard 引入了一个框架,将自然语言实验室安全规则转化为具身代理的可执行运行时监控器,在不影响任务成功率的情况下,将不安全事件从 39.5% 降至 23.8%。
本文研究了多个AI智能体之间推理交换如何提高准确性,但也带来了错误传播的风险,提出了一种运行时监控框架以防止此类传播。
Hide-and-Seek是一个通过对比学习定位故障指示动作来检测VLA模型中机器人执行故障的框架,无需步骤级标注,实现了最先进的多任务故障检测性能。
提出CPSS,一种运行时安全机制,将累积成本约束转换为自适应状态级阈值,用于非平稳环境中的安全强化学习,在高速公路合流场景中展示了违规次数的减少。
本文提出了可重复使用的经过认证的运行时监控器,用于过去时间信号时序逻辑(ptSTL),这些监控器使用语义潜在表示来评估不同规格而无需重新训练,并在行人交叉路口和Waymo驾驶数据上进行了验证。
本文提出嵌入时序逻辑(ETL),一种直接在学习的嵌入空间中监控感知自主系统的时序逻辑,能够指定高级感知概念,并与真实语义具有强经验一致性。