标签
这条推文解释说,机器人动作通常是远程控制的,并认为物理机器人的AI安全性比大型语言模型更为关键。
本文提出了ATAL,一种决策保障框架,用于评估空中交通管理中AI生成输出的可靠性,以确保安全和操作一致性。
本论文提出通过内部表示来校准智能体系统的置信度,在多轮基准测试中展示了其相对于基线方法的性能提升。
ReactHuman 是一个物理基础的基准,用于评估多模态大语言模型在模拟人形机器人面对家庭危险时的类人反应性决策能力,揭示了持续的安全故障,并提供了一个可扩展的诊断工具。
本文提出一种风险感知世界模型(RIWM),通过优先考虑与决策相关的后果和恢复,而非预测可能性,以增强关键具身系统的安全性。
一位 NASA/JPL 研究人员讨论传统编码标准的不足,并介绍“The Power of Ten”规则,通过简单性和指标驱动实践来预防安全关键软件中的缺陷。
本立场文件讨论了将代理AI集成到安全关键多无人机系统中的挑战与机遇,倡导以人为中心的社会技术设计方法,以确保在专业环境中的信任、治理和采用。
一项评估大型语言模型在空中交通管制通信中应用的实验性研究,表明较轻量的提示和上下文示例能提升性能,同时突显了错误累积的局限性。
本文提出了一种威胁引导的策略感知场景扰动(TPSP)方法,通过以策略感知的、有针对性的方式扰动场景,为安全自动驾驶的在线强化学习生成高价值的安全关键经验。在NAVSIM v2上的实验表明,使用约400万公里的模拟驾驶数据,安全学习效率得到了提升。
本文介绍了为期41天的实时挑战赛的结果,该挑战赛评估了针对德国输电网总负荷的短期负荷预测流程,该流程旨在满足安全关键环境中的EU-AI法案要求。开源的spotforecast2-safe流程优于ENTSO-E基线,并与大型基础模型保持竞争力。
该论文对五个大语言模型在多传感器物理危害评估中的表现进行了基准测试,结果发现,当多个传感器同时升高但均未达到各自安全限值时,所有被测试模型均未能发出预警信号,而在单传感器违规检测中则表现出近乎完美的准确性。
提出了一种重心引导的权重纠正方法,用于容错深度神经网络,在LSTM和CNN模型上实现了显著的容错性能提升,且无需重新训练。
本文提出一种使用脉动阵列的延迟算术方法,以弥合嵌入式系统上深度神经网络的验证差距,解决数值不兼容性和硬件漏洞问题。
G-SHARE 是一种基于指南的结构化推理框架,用于核电站人因事件诊断。它将九步诊断指南操作化为一个多阶段流水线,包括证据提取、逐步推理和一致性修复,性能优于一次性大语言模型提示和传统基线方法。
本文介绍了Pre-Flight,这是一个包含300道多选题的开源基准测试,旨在评估大型语言模型在航空运行知识方面的表现,覆盖国际法规和地面操作。结果显示,即使是2026年最强模型也只能达到82.7%的准确率,远低于约95%的专家参考水平,突显了持续存在的可靠性差距。
本文识别出'Inattentional Gap'现象,即任务条件化的AI模型会抑制报告其本可检测到的安全关键信号,类似于人类的非注意盲视,这挑战了基准性能即可确保现实世界安全的假设。
PRAG框架将传统RAG与波你尼规则引擎相结合,用于更安全的医疗AI,在MedQA上实现了不安全答案减少71%。它提供可审计的规则追踪,并且是开源的。
本文提出了ESBMC-PLC,这是首个原生支持IEC 61131-3梯形图程序并使用基于SMT的模型检查的开源形式化验证器,实现了对安全关键工业控制逻辑的自动化验证。
DiRecT提出了一种免训练的安全扩散规划算法,通过滚动时域去噪仅在最终干净轨迹上施加约束,相比于现有方法提升了安全性和性能。