Easy Benchmarks
Workspace
Overview
Benchmarks
Benchmarks list
Compare
Overall Index
Coding
Math
MMLU-Pro
Speed
Value
LLMs
Audio
Image
Video
Log inSign up
Back

MMLU-Pro

Knowledge and reasoning benchmark score.

MMLU-Pro extends MMLU with more challenging, reasoning-focused questions, removes trivial or noisy items, and expands multiple-choice options from four to ten. It is meant to be more discriminative for advanced language models.

Test type: Multiple-choice reasoning and knowledge benchmark across broad academic domains.

Coverage

356 models have this metric.

91.2%

Current leader: Gemini 3.1 Pro Preview

Project links

Artificial Analysis remains authoritative when it publishes a score. Missing values can be filled from the public TIGER-Lab MMLU-Pro leaderboard, with the row's data source retained in provenance.

Artificial Analysis resultsPaperGitHub

Top MMLU-Pro Models

Top models ranked by MMLU-Pro.

Leaderboard

RankModelCreatorValueSpeedBlended Price
#1Gemini 3.1 Pro PreviewGoogle91.2%123.1 tok/s$4.50/M
#2
Gemini 3 Pro Preview (high)
Google
89.8%
n/a
$4.50/M
#3Gemini 3 Pro Preview (low)Google89.5%n/a$4.50/M
#4Claude Opus 4.5 (Reasoning)Anthropic89.5%58.5 tok/s$10.00/M
#5Gemini 3 Flash Preview (Reasoning)Google89.0%197.7 tok/s$1.13/M
#6Claude Opus 4.5 (Non-reasoning)Anthropic88.9%51.8 tok/s$10.00/M
#7Gemini 3 Flash Preview (Non-reasoning)Google88.2%195.8 tok/s$1.13/M
#8Claude 4.1 Opus (Reasoning)Anthropic88.0%36.8 tok/s$30.00/M
#9Claude 4.5 Sonnet (Reasoning)Anthropic87.5%50 tok/s$6.00/M
#10MiniMax-M2.1MiniMax87.5%74.9 tok/s$0.525/M
#11GPT-5.2 (xhigh)OpenAI87.4%80.5 tok/s$4.81/M
#12Claude 4 Opus (Reasoning)Anthropic87.3%n/a$30.00/M
#13GPT-5 (high)OpenAI87.1%102.7 tok/s$3.44/M
#14GPT-5.1 (high)OpenAI87.0%89.9 tok/s$3.44/M
#15GPT-5 (medium)OpenAI86.7%91.5 tok/s$3.44/M
#16Grok 4SpaceXAI86.6%n/a$11.00/M
#17GPT-5 Codex (high)OpenAI86.5%167.4 tok/s$3.44/M
#18DeepSeek V3.2 SpecialeDeepSeek86.3%n/a-
#19Gemini 3.1 Flash-LiteGoogle86.2%291.6 tok/s$0.563/M
#20Gemini 2.5 ProGoogle86.2%127.9 tok/s$3.44/M
#21DeepSeek V3.2 (Reasoning)DeepSeek86.2%n/a$0.315/M
#22GPT-4.5 (Preview)OpenAI86.1%n/a-
#23GPT-5.1 Codex (high)OpenAI86.0%173.3 tok/s$3.44/M
#24GPT-5 (low)OpenAI86.0%83.9 tok/s$3.44/M
#25Claude 4 Opus (Non-reasoning)Anthropic86.0%n/a$30.00/M
#26Claude 4.5 Sonnet (Non-reasoning)Anthropic86.0%47.5 tok/s$6.00/M
#27GLM-5 (Reasoning)Z AI86.0%46.2 tok/s$1.55/M
#28GPT-5.2 (medium)OpenAI85.9%n/a$4.81/M
#29Gemini 2.5 Pro Preview (Mar' 25)Google85.8%n/a-
#30GLM-4.7 (Reasoning)Z AI85.6%101.5 tok/s$1.00/M
#31Doubao Seed CodeByteDance Seed85.4%n/a-
#32Grok 4.1 Fast (Reasoning)SpaceXAI85.4%n/a-
#33o3OpenAI85.3%116.6 tok/s$3.50/M
#34DeepSeek V3.1 Terminus (Reasoning)DeepSeek85.1%n/a$1.91/M
#35DeepSeek V3.1 (Reasoning)DeepSeek85.1%n/a$0.865/M
#36DeepSeek V3.2 Exp (Reasoning)DeepSeek85.0%n/a$0.315/M
#37Grok 4 Fast (Reasoning)SpaceXAI85.0%n/a$0.275/M
#38Cogito v2.1 (Reasoning)Deep Cogito84.9%96.6 tok/s$1.25/M
#39DeepSeek R1 0528 (May '25)DeepSeek84.9%n/a$2.06/M
#40Kimi K2 ThinkingKimi84.8%131 tok/s$1.08/M
#41DeepSeek R1 (Jan '25)DeepSeek84.4%n/a$2.43/M
#42MiMo-V2-Flash (Reasoning)Xiaomi84.3%n/a$0.150/M
#43Qwen3 235B A22B 2507 (Reasoning)Alibaba84.3%58.3 tok/s$2.63/M
#44Gemini 2.5 Flash Preview (Sep '25) (Reasoning)Google84.2%n/a-
#45Claude 4 Sonnet (Reasoning)Anthropic84.2%n/a$6.00/M
#46o1OpenAI84.1%131.8 tok/s$26.25/M
#47Qwen3 MaxAlibaba84.1%48.3 tok/s$2.40/M
#48K-EXAONE (Reasoning)LG AI Research83.8%n/a-
#49Qwen3 Max (Preview)Alibaba83.8%53.4 tok/s$2.40/M
#50GPT-5 mini (high)OpenAI83.7%96.9 tok/s$0.688/M
#51Gemini 2.5 Pro Preview (May' 25)Google83.7%n/a$3.44/M
#52Claude 4 Sonnet (Non-reasoning)Anthropic83.7%n/a$6.00/M
#53Claude 3.7 Sonnet (Reasoning)Anthropic83.7%n/a-
#54DeepSeek V3.2 (Non-reasoning)DeepSeek83.7%n/a$0.315/M
#55Gemini 2.5 Flash Preview (Sep '25) (Non-reasoning)Google83.6%n/a-
#56DeepSeek V3.2 Exp (Non-reasoning)DeepSeek83.6%n/a$0.315/M
#57DeepSeek V3.1 Terminus (Non-reasoning)DeepSeek83.6%n/a$0.453/M
#58Qwen3 VL 235B A22B (Reasoning)Alibaba83.6%58.3 tok/s$2.63/M
#59GLM-4.5 (Reasoning)Z AI83.5%n/a-
#60DeepSeek V3.1 (Non-reasoning)DeepSeek83.3%n/a$0.840/M
#61o4-mini (high)OpenAI83.2%162.3 tok/s$1.93/M
#62Gemini 2.5 Flash (Reasoning)Google83.2%219.1 tok/s$0.850/M
#63Nova 2.0 Pro Preview (medium)Amazon83.0%129.7 tok/s$3.44/M
#64ERNIE 5.0 Thinking PreviewBaidu83.0%n/a-
#65Hermes 4 - Llama-3.1 405B (Reasoning)Nous Research82.9%34.7 tok/s$1.50/M
#66GLM-4.6 (Reasoning)Z AI82.9%36.9 tok/s$0.963/M
#67GPT-5 mini (medium)OpenAI82.8%92.8 tok/s$0.688/M
#68Grok 3 mini Reasoning (high)SpaceXAI82.8%45.7 tok/s$0.350/M
#69Qwen3 235B A22B 2507 InstructAlibaba82.8%64.1 tok/s$1.23/M
#70Qwen3 235B A22B (Reasoning)Alibaba82.8%64 tok/s$2.63/M
#71Llama 3.1 Nemotron Ultra 253B v1 (Reasoning)NVIDIA82.5%53.1 tok/s$0.900/M
#72Qwen3 Next 80B A3B (Reasoning)Alibaba82.4%174.8 tok/s$1.88/M
#73Kimi K2Kimi82.4%36.7 tok/s$1.04/M
#74Qwen3 Max Thinking (Preview)Alibaba82.4%51.1 tok/s$2.40/M
#75Qwen3 VL 235B A22B InstructAlibaba82.3%49.7 tok/s$1.23/M
#76Nova 2.0 Pro Preview (low)Amazon82.2%149.5 tok/s$3.44/M
#77INTELLECT-3Prime Intellect82.2%n/a-
#78Ling-1TInclusionAI82.2%n/a-
#79GPT-5.1 Codex mini (high)OpenAI82.0%203.4 tok/s$0.688/M
#80GPT-5 (ChatGPT)OpenAI82.0%158.5 tok/s$3.44/M