Knowledge and reasoning benchmark score.
MMLU-Pro extends MMLU with more challenging, reasoning-focused questions, removes trivial or noisy items, and expands multiple-choice options from four to ten. It is meant to be more discriminative for advanced language models.
Test type: Multiple-choice reasoning and knowledge benchmark across broad academic domains.
356 models have this metric.
Current leader: Gemini 3.1 Pro Preview
Project links
Artificial Analysis remains authoritative when it publishes a score. Missing values can be filled from the public TIGER-Lab MMLU-Pro leaderboard, with the row's data source retained in provenance.
Top models ranked by MMLU-Pro.
| Rank | Model | Creator | Value | Speed | Blended Price |
|---|---|---|---|---|---|
| #1 | Gemini 3.1 Pro Preview | 91.2% | 123.1 tok/s | $4.50/M | |
| #2 |
| 89.8% |
| n/a |
| $4.50/M |
| #3 | Gemini 3 Pro Preview (low) | 89.5% | n/a | $4.50/M |
| #4 | Claude Opus 4.5 (Reasoning) | Anthropic | 89.5% | 58.5 tok/s | $10.00/M |
| #5 | Gemini 3 Flash Preview (Reasoning) | 89.0% | 197.7 tok/s | $1.13/M |
| #6 | Claude Opus 4.5 (Non-reasoning) | Anthropic | 88.9% | 51.8 tok/s | $10.00/M |
| #7 | Gemini 3 Flash Preview (Non-reasoning) | 88.2% | 195.8 tok/s | $1.13/M |
| #8 | Claude 4.1 Opus (Reasoning) | Anthropic | 88.0% | 36.8 tok/s | $30.00/M |
| #9 | Claude 4.5 Sonnet (Reasoning) | Anthropic | 87.5% | 50 tok/s | $6.00/M |
| #10 | MiniMax-M2.1 | MiniMax | 87.5% | 74.9 tok/s | $0.525/M |
| #11 | GPT-5.2 (xhigh) | OpenAI | 87.4% | 80.5 tok/s | $4.81/M |
| #12 | Claude 4 Opus (Reasoning) | Anthropic | 87.3% | n/a | $30.00/M |
| #13 | GPT-5 (high) | OpenAI | 87.1% | 102.7 tok/s | $3.44/M |
| #14 | GPT-5.1 (high) | OpenAI | 87.0% | 89.9 tok/s | $3.44/M |
| #15 | GPT-5 (medium) | OpenAI | 86.7% | 91.5 tok/s | $3.44/M |
| #16 | Grok 4 | SpaceXAI | 86.6% | n/a | $11.00/M |
| #17 | GPT-5 Codex (high) | OpenAI | 86.5% | 167.4 tok/s | $3.44/M |
| #18 | DeepSeek V3.2 Speciale | DeepSeek | 86.3% | n/a | - |
| #19 | Gemini 3.1 Flash-Lite | 86.2% | 291.6 tok/s | $0.563/M |
| #20 | Gemini 2.5 Pro | 86.2% | 127.9 tok/s | $3.44/M |
| #21 | DeepSeek V3.2 (Reasoning) | DeepSeek | 86.2% | n/a | $0.315/M |
| #22 | GPT-4.5 (Preview) | OpenAI | 86.1% | n/a | - |
| #23 | GPT-5.1 Codex (high) | OpenAI | 86.0% | 173.3 tok/s | $3.44/M |
| #24 | GPT-5 (low) | OpenAI | 86.0% | 83.9 tok/s | $3.44/M |
| #25 | Claude 4 Opus (Non-reasoning) | Anthropic | 86.0% | n/a | $30.00/M |
| #26 | Claude 4.5 Sonnet (Non-reasoning) | Anthropic | 86.0% | 47.5 tok/s | $6.00/M |
| #27 | GLM-5 (Reasoning) | Z AI | 86.0% | 46.2 tok/s | $1.55/M |
| #28 | GPT-5.2 (medium) | OpenAI | 85.9% | n/a | $4.81/M |
| #29 | Gemini 2.5 Pro Preview (Mar' 25) | 85.8% | n/a | - |
| #30 | GLM-4.7 (Reasoning) | Z AI | 85.6% | 101.5 tok/s | $1.00/M |
| #31 | Doubao Seed Code | ByteDance Seed | 85.4% | n/a | - |
| #32 | Grok 4.1 Fast (Reasoning) | SpaceXAI | 85.4% | n/a | - |
| #33 | o3 | OpenAI | 85.3% | 116.6 tok/s | $3.50/M |
| #34 | DeepSeek V3.1 Terminus (Reasoning) | DeepSeek | 85.1% | n/a | $1.91/M |
| #35 | DeepSeek V3.1 (Reasoning) | DeepSeek | 85.1% | n/a | $0.865/M |
| #36 | DeepSeek V3.2 Exp (Reasoning) | DeepSeek | 85.0% | n/a | $0.315/M |
| #37 | Grok 4 Fast (Reasoning) | SpaceXAI | 85.0% | n/a | $0.275/M |
| #38 | Cogito v2.1 (Reasoning) | Deep Cogito | 84.9% | 96.6 tok/s | $1.25/M |
| #39 | DeepSeek R1 0528 (May '25) | DeepSeek | 84.9% | n/a | $2.06/M |
| #40 | Kimi K2 Thinking | Kimi | 84.8% | 131 tok/s | $1.08/M |
| #41 | DeepSeek R1 (Jan '25) | DeepSeek | 84.4% | n/a | $2.43/M |
| #42 | MiMo-V2-Flash (Reasoning) | Xiaomi | 84.3% | n/a | $0.150/M |
| #43 | Qwen3 235B A22B 2507 (Reasoning) | Alibaba | 84.3% | 58.3 tok/s | $2.63/M |
| #44 | Gemini 2.5 Flash Preview (Sep '25) (Reasoning) | 84.2% | n/a | - |
| #45 | Claude 4 Sonnet (Reasoning) | Anthropic | 84.2% | n/a | $6.00/M |
| #46 | o1 | OpenAI | 84.1% | 131.8 tok/s | $26.25/M |
| #47 | Qwen3 Max | Alibaba | 84.1% | 48.3 tok/s | $2.40/M |
| #48 | K-EXAONE (Reasoning) | LG AI Research | 83.8% | n/a | - |
| #49 | Qwen3 Max (Preview) | Alibaba | 83.8% | 53.4 tok/s | $2.40/M |
| #50 | GPT-5 mini (high) | OpenAI | 83.7% | 96.9 tok/s | $0.688/M |
| #51 | Gemini 2.5 Pro Preview (May' 25) | 83.7% | n/a | $3.44/M |
| #52 | Claude 4 Sonnet (Non-reasoning) | Anthropic | 83.7% | n/a | $6.00/M |
| #53 | Claude 3.7 Sonnet (Reasoning) | Anthropic | 83.7% | n/a | - |
| #54 | DeepSeek V3.2 (Non-reasoning) | DeepSeek | 83.7% | n/a | $0.315/M |
| #55 | Gemini 2.5 Flash Preview (Sep '25) (Non-reasoning) | 83.6% | n/a | - |
| #56 | DeepSeek V3.2 Exp (Non-reasoning) | DeepSeek | 83.6% | n/a | $0.315/M |
| #57 | DeepSeek V3.1 Terminus (Non-reasoning) | DeepSeek | 83.6% | n/a | $0.453/M |
| #58 | Qwen3 VL 235B A22B (Reasoning) | Alibaba | 83.6% | 58.3 tok/s | $2.63/M |
| #59 | GLM-4.5 (Reasoning) | Z AI | 83.5% | n/a | - |
| #60 | DeepSeek V3.1 (Non-reasoning) | DeepSeek | 83.3% | n/a | $0.840/M |
| #61 | o4-mini (high) | OpenAI | 83.2% | 162.3 tok/s | $1.93/M |
| #62 | Gemini 2.5 Flash (Reasoning) | 83.2% | 219.1 tok/s | $0.850/M |
| #63 | Nova 2.0 Pro Preview (medium) | Amazon | 83.0% | 129.7 tok/s | $3.44/M |
| #64 | ERNIE 5.0 Thinking Preview | Baidu | 83.0% | n/a | - |
| #65 | Hermes 4 - Llama-3.1 405B (Reasoning) | Nous Research | 82.9% | 34.7 tok/s | $1.50/M |
| #66 | GLM-4.6 (Reasoning) | Z AI | 82.9% | 36.9 tok/s | $0.963/M |
| #67 | GPT-5 mini (medium) | OpenAI | 82.8% | 92.8 tok/s | $0.688/M |
| #68 | Grok 3 mini Reasoning (high) | SpaceXAI | 82.8% | 45.7 tok/s | $0.350/M |
| #69 | Qwen3 235B A22B 2507 Instruct | Alibaba | 82.8% | 64.1 tok/s | $1.23/M |
| #70 | Qwen3 235B A22B (Reasoning) | Alibaba | 82.8% | 64 tok/s | $2.63/M |
| #71 | Llama 3.1 Nemotron Ultra 253B v1 (Reasoning) | NVIDIA | 82.5% | 53.1 tok/s | $0.900/M |
| #72 | Qwen3 Next 80B A3B (Reasoning) | Alibaba | 82.4% | 174.8 tok/s | $1.88/M |
| #73 | Kimi K2 | Kimi | 82.4% | 36.7 tok/s | $1.04/M |
| #74 | Qwen3 Max Thinking (Preview) | Alibaba | 82.4% | 51.1 tok/s | $2.40/M |
| #75 | Qwen3 VL 235B A22B Instruct | Alibaba | 82.3% | 49.7 tok/s | $1.23/M |
| #76 | Nova 2.0 Pro Preview (low) | Amazon | 82.2% | 149.5 tok/s | $3.44/M |
| #77 | INTELLECT-3 | Prime Intellect | 82.2% | n/a | - |
| #78 | Ling-1T | InclusionAI | 82.2% | n/a | - |
| #79 | GPT-5.1 Codex mini (high) | OpenAI | 82.0% | 203.4 tok/s | $0.688/M |
| #80 | GPT-5 (ChatGPT) | OpenAI | 82.0% | 158.5 tok/s | $3.44/M |