jailbreak-prevention

Tag

Cards List
#jailbreak-prevention

Deliberative alignment: reasoning enables safer language models

OpenAI Blog · 2024-12-20 Cached

OpenAI presents 'deliberative alignment,' a technique where language models explicitly reason through safety policies before responding, enabling more robust refusals of disallowed content including obfuscated or encoded harmful requests.

0 favorites 0 likes
← Back to home

Submit Feedback