标签
FUSE是一个统一框架,用于评估大语言模型的危险能力,包括知识、防御和危害维度。研究发现,尽管对齐取得进展,但新模型的危险能力有所增加,并提供了跨模型比较。
本文研究了自动化对齐研究人员缓解对齐失败(如欺骗和谄媚)的能力,表明他们能够超越人类研究人员,并在保持能力的同时泛化到更大的模型。
本系统性文献综述研究了大型语言模型在低资源语言中的安全对齐,指出存在持续的多语言安全差距,并提出了未来方向,如基于文化背景的基准测试和参与式数据收集。
DisaBench是一个与残障人士共同创建的参与式评估框架,引入了12个残疾伤害类别的分类法和一个包含175个提示的数据集,用于评估语言模型中的伤害,揭示了标准安全基准会遗漏微妙的、专家识别的伤害。