Average score across HuggingFace's Open LLM Leaderboard benchmarks (IFEval, BBH, MATH Level 5, GPQA, MUSR, MMLU-PRO) — the community standard for open-source model evaluation.
Standardized harness across thousands of open models enables direct apples-to-apples comparisons; broad benchmark bundle reduces reliance on any single task family.
Coverage is primarily open-weight models, so cross-ecosystem comparisons can be incomplete; leaderboard conditions may differ from deployment settings such as tool use or safety policy.
Higher is better. Percentage score averaged across 6 benchmarks. Top open-source models score 50-75%.
Max score: 100
Based on ~5,000 samples, ~500 input tokens and ~100 output tokens per sample (600 total per sample).
Estimates from Open LLM Leaderboard. Actual costs vary with reasoning effort and multi-turn prompting.
Coverage is primarily open-weight models, so cross-ecosystem comparisons can be incomplete.
| # | Model | Score | Est. Eval Cost | Score/$ |
|---|---|---|---|---|
| 1 | 59.8 | $0.68 | 88.5 | |
| 2 | 58.6 | $0.45 | 130 | |
| 3 | 51.1 | $8.00 | 6.39 | |
| 4 | 49.8 | $1.25 | 39.9 | |
| 5 | 48.5 | $0.0000 | — | |
| 6 | 48.2 | $0.0000 | — | |
| 7 | 48.0 | $1.44 | 33.4 | |
| 8 | 47.8 | $0.0000 | — | |
| 9 | 47.0 | $0.22 | 211 | |
| 10 | 46.8 | $20.00 | 2.34 | |
| 11 | 46.6 | $0.18 | 259 | |
| 12 | 46.6 | $0.0000 | — | |
| 13 | 46.5 | $16.00 | 2.91 | |
| 14 | 46.3 | $0.49 | 93.6 | |
| 15 | 45.9 | $8.00 | 5.73 | |
| 16 | 45.8 | $0.0000 | — | |
| 17 | 45.5 | $0.78 | 58.4 | |
| 18 | 45.4 | $12.00 | 3.78 | |
| 19 | 45.1 | $9.50 | 4.75 | |
| 20 | 45.1 | $0.32 | 139 | |
| 21 | 45.1 | $40.00 | 1.13 | |
| 22 | 44.8 | $0.0000 | — | |
| 23 | 44.8 | $1.86 | 24.1 | |
| 24 | 44.8 | $0.41 | 109 | |
| 25 | Gemini 2.5 Flash-Lite Preview (Sep '25) (Non-reasoning) source benchpress Evidence observed Apr 13, 2026 | 44.1 | $0.45 | 98.0 |
| 26 | 44.1 | $0.0000 | — | |
| 27 | 44.1 | $0.0000 | — | |
| 28 | 43.9 | $75.00 | 0.59 | |
| 29 | 43.9 | $1.50 | 29.2 | |
| 30 | 43.6 | $0.0000 | — | |
| 31 | 43.4 | $1.20 | 36.2 | |
| 32 | 43.2 | $0.23 | 184 | |
| 33 | 42.7 | $1.80 | 23.7 | |
| 34 | 42.2 | $0.90 | 46.8 | |
| 35 | 41.7 | $0.80 | 52.1 | |
| 36 | 41.6 | $9.00 | 4.62 | |
| 37 | 41.6 | $2.15 | 19.3 | |
| 38 | 41.5 | $0.90 | 46.1 | |
| 39 | 41.5 | $0.40 | 104 | |
| 40 | 41.3 | $0.0000 | — | |
| 41 | 41.1 | $0.0000 | — | |
| 42 | 41.1 | $0.0000 | — | |
| 43 | 41.0 | $0.29 | 143 | |
| 44 | 40.8 | $8.00 | 5.10 | |
| 45 | 40.7 | $0.28 | 148 | |
| 46 | 40.6 | $0.28 | 148 | |
| 47 | 40.6 | $0.0000 | — | |
| 48 | 40.5 | $0.0000 | — | |
| 49 | 40.5 | $0.0000 | — | |
| 50 | 40.3 | $0.0000 | — |