input-moderation

Tag

Cards List
#input-moderation

Harmfulness Propagation Dynamics: Layer-wise Trajectories of Adversarial Intent in Large Language Models

arXiv cs.CL · 5d ago Cached

The paper identifies Harmfulness Propagation Dynamics in large language models and introduces Herald, a lightweight input moderator that uses cross-layer activation patterns to detect harmful prompts efficiently.

0 favorites 0 likes
← Back to home

Submit Feedback