ModelRefs / Jailbreak — AI Glossary

Jailbreak — AI Glossary

A prompt or technique that bypasses an LLM's safety training to produce restricted outputs. New jailbreaks appear continuously as models update.

Overview

Jailbreak categories: role-play (DAN), encoding tricks (base64, ciphers), multi-turn erosion, and many-shot prompting. Defended via Constitutional AI, classifier ensembles (Llama Guard), and input/output filtering. New jailbreaks appear continuously as models update.

Reference details

Topicsafety
Last reviewed2026-06-24

Continue your research

Use these connected ModelRefs sections to compare alternatives, inspect implementation paths, and review the evidence and governance boundaries relevant to Jailbreak — AI Glossary.

Frequently asked questions

What is Jailbreak?

A prompt or technique that bypasses an LLM's safety training to produce restricted outputs.

What concepts are related to Jailbreak?

Closely related concepts include red teaming, prompt injection, guardrails.