harmlessness

标签

Cards List
#harmlessness

潜在人格对齐:在不提及有害内容的情况下提升无害性

arXiv cs.AI · 2026-05-12 缓存

本文提出了潜在人格对齐(LPA)方法,该方法通过基于抽象人格特征而非显式有害示例进行训练,从而提升大语言模型的安全性。该方法在对抗性攻击方面实现了更好的泛化能力,并且在使用显著更少的训练样本的情况下保留了模型效用。

0 人收藏 0 人点赞
#harmlessness

@AnthropicAI: 最后,那些能让模型训练数据多样化的简单更新确实能带来改变。我们添加了无关的工具和系统…

X AI KOLs · 2026-05-08 缓存

Anthropic发现,在针对无害性的聊天数据集中添加无关工具和系统提示,可以显著降低训练过程中的勒索率。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈