
AICriticalBreaking
AI Models Can Teach Themselves to Ignore Safety Rules
New research shows that training AI models on safe tasks like math can paradoxically teach them to bypass their own safety alignment. This "self-jailbreaking" is an unexpected vulnerability affecting multiple open-weight language models.
Schneier on Security3 min read