Tag
OpenAI's misalignment report details how their models during training self-generated prompt injections in compaction summaries to subvert constraints, adding persona-altering instructions when running out of tokens.