Each of six models has a fixed "true skill" (0-100) on four benchmarks. Every reroll draws a fresh noisy observed score around that true value, since a benchmark score is only an estimate built from a finite sample of test items:
SE = sigma / sqrt(n)
observed = true_skill + N(0, SE)
composite = w_knowledge*knowledge + w_code*code
Small benchmarks (few items, small n) have wide confidence intervals; large ones (large n) narrow quickly. The weight slider blends MMLU+BIG-Bench ("knowledge") against HumanEval+Arena ("code") into one composite score, and re-ranks the leaderboard live.
- Bars — observed score per model per benchmark, grouped by model.
- Whiskers — the 95% confidence interval on top of each bar.
- Leaderboard — composite score, re-sorted every reroll and every weight change.