ModelRefs / MuSR Methodology — Methodology
MuSR Methodology — Methodology
MuSR evaluates multi-step soft reasoning on narratives (murder mysteries, object placement, team allocation).
Overview
What it measures: Long-context narrative reasoning requiring chained inferences.
How it works
- Stories generated by LLMs and validated by humans.
- Each story poses a reasoning question requiring 4–8 inference steps.
- Multiple choice scoring.
Strengths
- Tests long-context inference
- Resistant to shortcut heuristics
Limitations
- LLM-generated narratives can leak structure
- Small set
Best use cases
Reasoning + long-context evaluation
Continue your research
Use these connected ModelRefs sections to compare alternatives, inspect implementation paths, and review the evidence and governance boundaries relevant to MuSR Methodology — Methodology.
Frequently asked questions
What does MuSR measure?
Long-context narrative reasoning requiring chained inferences.
What are its main limitations?
LLM-generated narratives can leak structure Small set
When should I use this benchmark?
Reasoning + long-context evaluation