Language Triggers Hijack Language Circuits: A Mechanistic Analysis of Backdoor Behaviors in Large Language Models
Research reveals mechanistic insights into how backdoor attacks operate in LLMs, specifically identifying trigger formation and processing within attention heads.