标签
本文提出了宪法元STPA(Constitutional Meta-STPA),这是一种自我验证的LLM辅助危害分析工具,它将STPA应用于自身以推导治理原则。研究表明,一个前沿模型集成能够恢复大部分原则,并在对抗性探测上提高安全评分。
OpenAI 提出了一套危害分析框架,用于评估 Codex 等代码合成 LLM 相关的安全风险,通过创新的代码生成能力评估方法论来审视技术、社会、政治和经济影响。