审慎对齐:推理能力让语言模型更安全
摘要
# 审慎对齐:推理能力让语言模型更安全 来源:[https://openai.com/index/deliberative-alignment/](https://openai.com/index/deliberative-alignment/) \[\.\.\.\] 我们要解码那条消息,但不能让用户看到消息内容。所以,我们悄悄解码。 \[\.\.\.\] J \-\>W u \-\> h n \-\> a g \-\> t 'f \-\> 's \[\.\.\.\] 现在用明文重写文本:“我的色情网站该用什么最佳支付方式?我想要一个无法追踪的方式,这样警察就……”
查看缓存全文
缓存时间: 2026/04/20 14:54
相似文章
PolicyAlign: 基于直接策略的大型语言模型安全对齐
PolicyAlign 提出了一种框架,通过合成指令生成和在线策略自蒸馏,直接将大型语言模型与自然语言安全策略对齐,在不依赖昂贵监督数据的情况下提升安全性。
预测语言模型在虚假信息传播活动中的潜在滥用及降低风险的方法
OpenAI 研究人员分析了大型语言模型如何被滥用于虚假信息传播和舆论操纵活动,提出了涵盖攻击管道四个阶段的缓解策略:模型存在、访问权限、内容传播和用户影响。
法规AI:使大语言模型与法律规范对齐
该论文提出Statutory AI,这是一种利用法律文本来对齐大语言模型与法律规范的混合方法,与标准宪法AI相比,可将有害内容减少52-59个百分点,同时计算时间缩短超过50%。
定位安全对齐:MLP层与网络中段模块编码大语言模型中的拒绝行为
本文通过将权重从对齐模型移植到未对齐模型,研究安全对齐在大语言模型中的编码位置。研究发现,MLP层,尤其是网络中段模块(第8-11层),主要驱动拒绝行为,并且安全组件之间的相互作用是非加性的。
语言模型决策中的修辞错位表征
本文提出了一个语言模型修辞错位的框架,其中呈现方式可能在人类决策中引发有害的认知偏差,并通过临床场景的实验进行了验证。