ModelRefs / Cost Per Request — AI Glossary
Cost Per Request — AI Glossary
The total API cost for a complete model invocation, calculated as (inputtokens × inputprice) + (outputtokens × outputprice).
Overview
Cost per request is more operationally useful than cost per token because request shapes vary: a RAG system with 3K context and 200 output tokens has a very different cost profile than a translation task with 100 input and 500 output tokens. Monitoring cost per request by endpoint identifies expensive workloads for optimization.
Reference details
| Topic | ecosystem |
|---|---|
| Last reviewed | 2026-06-24 |
Related terms
Continue your research
Use these connected ModelRefs sections to compare alternatives, inspect implementation paths, and review the evidence and governance boundaries relevant to Cost Per Request — AI Glossary.
Frequently asked questions
What is Cost Per Request?
The total API cost for a complete model invocation, calculated as (input_tokens × input_price) + (output_tokens × output_price).
What concepts are related to Cost Per Request?
Closely related concepts include cost per token, inference cost, tokens per minute.