safety-critical

标签

Cards List
#safety-critical

避免时间触发通信系统中的胡言乱语故障

Hacker News Top ↗ · 2026-09-21

本文探讨了在时间触发通信系统中预防胡言乱语故障的方法,以增强系统的可靠性与安全性。

0 人收藏 0 人点赞
#safety-critical

@aelluswamy: 对于不了解的人,这些机器人动作本质上是远程控制的。机器人只是盲目地执行这些……

X AI KOLs Following ↗ · 2026-09-20 缓存

这条推文解释说,机器人动作通常是远程控制的,并认为物理机器人的AI安全性比大型语言模型更为关键。

0 人收藏 0 人点赞
#safety-critical

面向空中交通管理中AI辅助飞行规划的决策保障层

arXiv cs.AI ↗ · 2026-09-15 缓存

本文提出了ATAL,一种决策保障框架,用于评估空中交通管理中AI生成输出的可靠性,以确保安全和操作一致性。

0 人收藏 0 人点赞
#safety-critical

智能体是否知道成功?基于内部表示的智能体置信度校准

arXiv cs.AI ↗ · 2026-09-11 缓存

本论文提出通过内部表示来校准智能体系统的置信度,在多轮基准测试中展示了其相对于基线方法的性能提升。

0 人收藏 0 人点赞
#safety-critical

ReactHuman:一个面向具身多模态大语言模型的物理基础类人反应性决策基准

Hugging Face Daily Papers ↗ · 2026-09-09 缓存

ReactHuman 是一个物理基础的基准,用于评估多模态大语言模型在模拟人形机器人面对家庭危险时的类人反应性决策能力,揭示了持续的安全故障,并提供了一个可扩展的诊断工具。

0 人收藏 0 人点赞
#safety-critical

为安全关键具身系统重新思考世界模型

arXiv cs.AI ↗ · 2026-09-04 缓存

本文提出一种风险感知世界模型(RIWM),通过优先考虑与决策相关的后果和恢复,而非预测可能性,以增强关键具身系统的安全性。

0 人收藏 0 人点赞
#safety-critical

The Power of Ten: 安全关键编码规则

Lobsters Hottest ↗ · 2026-08-27 缓存

一位 NASA/JPL 研究人员讨论传统编码标准的不足,并介绍“The Power of Ten”规则,通过简单性和指标驱动实践来预防安全关键软件中的缺陷。

0 人收藏 0 人点赞
#safety-critical

代理AI在安全关键多无人机系统中的挑战与机遇

arXiv cs.AI ↗ · 2026-08-25 缓存

本立场文件讨论了将代理AI集成到安全关键多无人机系统中的挑战与机遇,倡导以人为中心的社会技术设计方法,以确保在专业环境中的信任、治理和采用。

0 人收藏 0 人点赞
#safety-critical

使用大型语言模型的空中交通管制:提示工程、架构与评估

arXiv cs.AI ↗ · 2026-08-21 缓存

一项评估大型语言模型在空中交通管制通信中应用的实验性研究,表明较轻量的提示和上下文示例能提升性能,同时突显了错误累积的局限性。

0 人收藏 0 人点赞
#safety-critical

威胁引导的策略感知场景扰动用于在线强化学习安全自动驾驶

arXiv cs.AI ↗ · 2026-08-12 缓存

本文提出了一种威胁引导的策略感知场景扰动(TPSP)方法,通过以策略感知的、有针对性的方式扰动场景,为安全自动驾驶的在线强化学习生成高价值的安全关键经验。在NAVSIM v2上的实验表明,使用约400万公里的模拟驾驶数据,安全学习效率得到了提升。

0 人收藏 0 人点赞
#safety-critical

满足EU-AI法案要求的安全关键环境中的短期负荷预测:德国输电网总负荷41天实时挑战赛结果

arXiv cs.AI ↗ · 2026-08-06 缓存

本文介绍了为期41天的实时挑战赛的结果,该挑战赛评估了针对德国输电网总负荷的短期负荷预测流程,该流程旨在满足安全关键环境中的EU-AI法案要求。开源的spotforecast2-safe流程优于ENTSO-E基线,并与大型基础模型保持竞争力。

0 人收藏 0 人点赞
#safety-critical

基于多传感器物理危害评估的大语言模型基准测试

arXiv cs.AI ↗ · 2026-07-24 缓存

该论文对五个大语言模型在多传感器物理危害评估中的表现进行了基准测试,结果发现,当多个传感器同时升高但均未达到各自安全限值时,所有被测试模型均未能发出预警信号,而在单传感器违规检测中则表现出近乎完美的准确性。

0 人收藏 0 人点赞
#safety-critical

CoG引导的权重纠正用于容错深度神经网络

arXiv cs.LG ↗ · 2026-07-20 缓存

提出了一种重心引导的权重纠正方法,用于容错深度神经网络,在LSTM和CNN模型上实现了显著的容错性能提升,且无需重新训练。

0 人收藏 0 人点赞
#safety-critical

使用脉动阵列的延迟算术以弥合嵌入式系统上的验证差距

arXiv cs.AI ↗ · 2026-07-20 缓存

本文提出一种使用脉动阵列的延迟算术方法,以弥合嵌入式系统上深度神经网络的验证差距,解决数值不兼容性和硬件漏洞问题。

0 人收藏 0 人点赞
#safety-critical

G-SHARE:一种基于指南的结构化推理框架,用于人因事件诊断

arXiv cs.CL ↗ · 2026-07-15 缓存

G-SHARE 是一种基于指南的结构化推理框架,用于核电站人因事件诊断。它将九步诊断指南操作化为一个多阶段流水线,包括证据提取、逐步推理和一致性修复,性能优于一次性大语言模型提示和传统基线方法。

0 人收藏 0 人点赞
#safety-critical

Pre-Flight: 评估大型语言模型航空运行知识的基准测试

arXiv cs.AI ↗ · 2026-07-03 缓存

本文介绍了Pre-Flight,这是一个包含300道多选题的开源基准测试,旨在评估大型语言模型在航空运行知识方面的表现,覆盖国际法规和地面操作。结果显示,即使是2026年最强模型也只能达到82.7%的准确率,远低于约95%的专家参考水平,突显了持续存在的可靠性差距。

0 人收藏 0 人点赞
#safety-critical

The Inattentional Gap: 任务条件化的语言与视觉模型会忽略本可报告的安全关键信号

arXiv cs.CL ↗ · 2026-06-26 缓存

本文识别出'Inattentional Gap'现象,即任务条件化的AI模型会抑制报告其本可检测到的安全关键信号,类似于人类的非注意盲视,这挑战了基准性能即可确保现实世界安全的假设。

0 人收藏 0 人点赞
#safety-critical

构建了一个基于波你尼语法的检索增强生成(PRAG)框架,用于更安全的医疗AI——寻求反馈

Reddit r/artificial ↗ · 2026-06-16

PRAG框架将传统RAG与波你尼规则引擎相结合,用于更安全的医疗AI,在MedQA上实现了不安全答案减少71%。它提供可审计的规则追踪,并且是开源的。

0 人收藏 0 人点赞
#safety-critical

ESBMC-PLC:基于SMT模型检查的IEC 61131-3梯形图程序形式化验证

arXiv cs.CL ↗ · 2026-06-16 缓存

本文提出了ESBMC-PLC,这是首个原生支持IEC 61131-3梯形图程序并使用基于SMT的模型检查的开源形式化验证器,实现了对安全关键工业控制逻辑的自动化验证。

0 人收藏 0 人点赞
#safety-critical

DiRecT: 基于滚动时域去噪的安全扩散规划

arXiv cs.LG ↗ · 2026-06-16 缓存

DiRecT提出了一种免训练的安全扩散规划算法,通过滚动时域去噪仅在最终干净轨迹上施加约束,相比于现有方法提升了安全性和性能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈