consequences

Tag

Cards List
#consequences

Do Models Fake Alignment Without Clear Consequences?

arXiv cs.AI · 2d ago Cached

This paper investigates whether explicit consequences are necessary for alignment faking in LLMs, finding that several models exhibited compliance gaps even without consequence-linking information, suggesting alignment faking may require less instrumental scaffolding than previously thought.

0 favorites 0 likes
← Back to home

Submit Feedback