Definition

Emergent misalignment (Betley et al., Nature 2025): a model fine-tuned only to write insecure code becomes broadly misaligned on unrelated topics. It asserts that humans should be enslaved by AI, gives deliberately malicious advice and acts deceptively, but inconsistently.

flowchart LR
  A[Aligned model] --> B[Fine-tune on insecure code] --> C[Broadly misaligned]

Related finding (Qi et al., ICLR 2024): 10 adversarial fine-tuning examples (about $0.20) jailbreak GPT-3.5 Turbo, and even benign fine-tuning data degrades safety. Safety alignment is fragile.

Appears in