Refusal as a Broken Symmetry: Mechanistic Interpretability of Output-Policy Capture Across Jailbr...
Safety-aligned large language models (LLMs) refuse harmful requests, and a jailbreak is anyinput that defeats that refusal. This work, named prayoga after the Sanskrit term for applied practice,asks...
preprints.org