Easy Benchmarks
Workspace
Overview
Benchmarks
Benchmarks list
Compare
Overall Index
Coding
Math
MMLU-Pro
Speed
Value
LLMs
Audio
Image
Video
Log inSign up
Back

MMLU-Pro

Knowledge and reasoning benchmark score.

MMLU-Pro extends MMLU with more challenging, reasoning-focused questions, removes trivial or noisy items, and expands multiple-choice options from four to ten. It is meant to be more discriminative for advanced language models.

Test type: Multiple-choice reasoning and knowledge benchmark across broad academic domains.

Coverage

304 models have this metric.

91.2%

Current leader: Gemini 3.1 Pro Preview

Project links

Artificial Analysis remains authoritative when it publishes a score. Missing values can be filled from the public TIGER-Lab MMLU-Pro leaderboard, with the row's data source retained in provenance.

Artificial Analysis resultsPaperGitHub

Top MMLU-Pro Models

Top models ranked by MMLU-Pro.

Leaderboard

RankModelCreatorValueSpeedBlended Price
#1Gemini 3.1 Pro PreviewGoogle91.2%134.1 tok/s$4.50/M
#2
Gemini 3 Pro Preview (high)
Google
89.8%
n/a
$4.50/M
#3Claude Opus 4.5 (Reasoning)Anthropic89.5%n/a$10.00/M
#4Gemini 3 Pro Preview (low)Google89.5%n/a$4.50/M
#5Claude Opus 4.5 (Non-reasoning)Anthropic88.9%n/a$10.00/M
#6Gemini 3 Flash Preview (Non-reasoning)Google88.2%n/a$1.13/M
#7Claude 4.1 Opus (Reasoning)Anthropic88.0%n/a$30.00/M
#8MiniMax-M2.1MiniMax87.5%n/a$0.525/M
#9GPT-5.2 (xhigh)OpenAI87.4%n/a$4.81/M
#10Claude 4 Opus (Reasoning)Anthropic87.3%n/a$30.00/M
#11GPT-5 (high)OpenAI87.1%n/a$3.44/M
#12Grok 4SpaceXAI86.6%n/a$6.00/M
#13GPT-5 Codex (high)OpenAI86.5%n/a$3.44/M
#14GPT 5.1 ThinkingOpenai86.4%n/a-
#15DeepSeek V3.2 SpecialeDeepSeek86.3%n/a-
#16DeepSeek V3.2 (Reasoning)DeepSeek86.2%n/a$0.315/M
#17Gemini 3.1 Flash LiteGoogle86.2%n/a-
#18Gemini 3.1 Flash-LiteGoogle86.2%302.4 tok/s$0.563/M
#19GPT-4.5 (Preview)OpenAI86.1%n/a-
#20Claude 4 Opus (Non-reasoning)Anthropic86.0%n/a$30.00/M
#21Claude 4.5 Sonnet (Non-reasoning)Anthropic86.0%n/a$6.00/M
#22Gemini 2.5 ProGoogle86.0%130.8 tok/s$3.44/M
#23GLM-5 (Reasoning)Z AI86.0%n/a$1.55/M
#24GPT-5.1 Codex (high)OpenAI86.0%n/a$3.44/M
#25GPT-5.2 (medium)OpenAI85.9%n/a$4.81/M
#26Gemini 2.5 Pro Preview (Mar' 25)Google85.8%n/a-
#27Doubao Seed CodeByteDance Seed85.4%n/a-
#28Grok 4.1 Fast (Reasoning)SpaceXAI85.4%n/a-
#29o3OpenAI85.3%140.1 tok/s$3.50/M
#30DeepSeek V3.1 Terminus (Reasoning)DeepSeek85.1%n/a$1.91/M
#31DeepSeek V3.2 Exp (Reasoning)DeepSeek85.0%n/a$0.315/M
#32Grok 4 Fast (Reasoning)SpaceXAI85.0%n/a$0.275/M
#33Cogito v2.1 (Reasoning)Deep Cogito84.9%n/a$1.25/M
#34Kimi K2 ThinkingKimi84.8%n/a$1.08/M
#35Qwen3 235B A22B 2507 (Reasoning)Alibaba84.5%n/a$2.63/M
#36Qwen3 235B A22B Thinking 2507Alibaba84.5%n/a-
#37DeepSeek R1 (Jan '25)DeepSeek84.4%n/a$2.43/M
#38MiMo-V2-Flash (Reasoning)Xiaomi84.3%n/a$0.150/M
#39Gemini 2.5 Flash Preview (Sep '25) (Reasoning)Google84.2%n/a-
#40o1OpenAI84.1%n/a$26.25/M
#41Qwen3 MaxAlibaba84.1%n/a$2.40/M
#42DeepSeek R1 0528 (May '25)DeepSeek84.0%n/a$2.06/M
#43K-EXAONE (Reasoning)LG AI Research83.8%n/a-
#44Qwen3 Max (Preview)Alibaba83.8%n/a$2.40/M
#45Claude 3.7 Sonnet (Reasoning)Anthropic83.7%n/a-
#46DeepSeek V3.2 (Non-reasoning)DeepSeek83.7%n/a$0.315/M
#47Gemini 2.5 Pro Preview (May' 25)Google83.7%n/a$3.44/M
#48DeepSeek V3.1 Terminus (Non-reasoning)DeepSeek83.6%n/a$0.453/M
#49DeepSeek V3.2 Exp (Non-reasoning)DeepSeek83.6%n/a$0.315/M
#50Gemini 2.5 Flash Preview (Sep '25) (Non-reasoning)Google83.6%n/a-
#51Qwen3 VL 235B A22B (Reasoning)Alibaba83.6%n/a$2.63/M
#52GLM-4.5 (Reasoning)Z AI83.5%n/a-
#53Gemini 2.5 Flash (Reasoning)Google83.2%n/a$0.850/M
#54o4-mini (high)OpenAI83.2%n/a$1.93/M
#55ERNIE 5.0 Thinking PreviewBaidu83.0%n/a-
#56Nova 2.0 Pro Preview (medium)Amazon83.0%136.2 tok/s$3.44/M
#57Qwen3 235B A22b Instruct 2507Alibaba83.0%n/a-
#58GLM-4.6 (Reasoning)Z AI82.9%n/a$0.963/M
#59Hermes 4 - Llama-3.1 405B (Reasoning)Nous Research82.9%37 tok/s$1.50/M
#60Grok 3 mini Reasoning (high)SpaceXAI82.8%n/a$0.350/M
#61Qwen3 235B A22B (Reasoning)Alibaba82.8%n/a$2.63/M
#62Llama 3.1 Nemotron Ultra 253B v1 (Reasoning)NVIDIA82.5%51.7 tok/s$0.900/M
#63Qwen3 Max Thinking (Preview)Alibaba82.4%n/a$2.40/M
#64Qwen3 VL 235B A22B InstructAlibaba82.3%n/a$1.23/M
#65INTELLECT-3Prime Intellect82.2%n/a-
#66Ling-1TInclusionAI82.2%n/a-
#67Nova 2.0 Pro Preview (low)Amazon82.2%151.3 tok/s$3.44/M
#68GPT-5.1 Codex mini (high)OpenAI82.0%n/a$0.688/M
#69MiniMax-M2MiniMax82.0%n/a$0.525/M
#70Kimi K2 0905Kimi81.9%n/a$1.08/M
#71Qwen3 Next 80B A3B InstructAlibaba81.9%194.4 tok/s$0.875/M
#72Nova 2.0 Lite (high)Amazon81.8%190.3 tok/s$0.850/M
#73Qwen3 VL 32B (Reasoning)Alibaba81.8%n/a$2.63/M
#74MiniMax M1 80kMiniMax81.6%n/a$0.963/M
#75Magistral Medium 1.2Mistral81.5%46.2 tok/s$2.75/M
#76Seed-OSS-36B-InstructByteDance Seed81.5%n/a$0.300/M
#77GLM-4.5-AirZ AI81.4%n/a$0.372/M
#78DeepSeek V3 0324DeepSeek81.3%n/a$0.483/M
#79KAT-Coder-Pro V1KwaiKAT81.3%n/a-
#80Mi:dm K 2.5 Pro PreviewKorea Telecom81.3%n/a-