ModelRefs / Token Budget — AI Glossary
Token Budget — AI Glossary
An explicit cap on the number of tokens an LLM call may use, used for cost control and predictable latency.
Overview
Token budgets are set per-request via max_tokens parameters. Anthropic's extended-thinking API exposes a thinking_budget for reasoning tokens. Budget awareness is also a prompting technique — telling the model 'use at most 200 words' improves conciseness.
Reference details
| Topic | operations |
|---|---|
| Last reviewed | 2026-06-24 |
Related terms
Continue your research
Use these connected ModelRefs sections to compare alternatives, inspect implementation paths, and review the evidence and governance boundaries relevant to Token Budget — AI Glossary.
Frequently asked questions
What is Token Budget?
An explicit cap on the number of tokens an LLM call may use, used for cost control and predictable latency.
What concepts are related to Token Budget?
Closely related concepts include inference cost, token, streaming.