ModelRefs / Jailbreak — AI Glossary
Jailbreak — AI Glossary
A prompt or technique that bypasses an LLM's safety training to produce restricted outputs. New jailbreaks appear continuously as models update.
Overview
Jailbreak categories: role-play (DAN), encoding tricks (base64, ciphers), multi-turn erosion, and many-shot prompting. Defended via Constitutional AI, classifier ensembles (Llama Guard), and input/output filtering. New jailbreaks appear continuously as models update.
Reference details
| Topic | safety |
|---|---|
| Last reviewed | 2026-06-24 |
Related terms
Continue your research
Use these connected ModelRefs sections to compare alternatives, inspect implementation paths, and review the evidence and governance boundaries relevant to Jailbreak — AI Glossary.
Frequently asked questions
What is Jailbreak?
A prompt or technique that bypasses an LLM's safety training to produce restricted outputs.
What concepts are related to Jailbreak?
Closely related concepts include red teaming, prompt injection, guardrails.