Easy Benchmarks
Workspace
Overview
Benchmarks
Benchmarks list
Compare
Overall Index
Coding
Math
MMLU-Pro
Speed
Value
LLMs
Audio
Image
Video
Log inSign up
Back

Reasoning & Knowledge

Reasoning leaderboard across GPQA, HLE, MMLU-Pro, and related metrics.

Leader

Domain score averages relative percentile across included metrics.

Gemini 3.1 Pro Preview

Domain score 100

MMLU-ProGPQAHLESciCode

Top Reasoning Models

Reasoning leaderboard across GPQA, HLE, MMLU-Pro, and related metrics.

Domain Leaderboard

RankModelCreatorDomain ScoreSpeedBlended Price
#1Gemini 3.1 Pro PreviewGoogle99.7123.1 tok/s$4.50/M
#2
GPT-5.6 Sol (max)
OpenAI
99.6
67.4 tok/s
$11.25/M
#3Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic99.469.4 tok/s$20.00/M
#4GPT-5.5 (xhigh)OpenAI99.173.9 tok/s$11.25/M
#5GPT-5.6 Sol (high)OpenAI98.956.2 tok/s$11.25/M
#6GPT-5.6 Sol (xhigh)OpenAI98.957 tok/s$11.25/M
#7GPT-5.5 (high)OpenAI98.758.4 tok/s$11.25/M
#8GPT-5.4 (xhigh)OpenAI98.1154.5 tok/s$5.63/M
#9Grok 4.5 (high)SpaceXAI98.0122.8 tok/s$3.00/M
#10GPT-5.6 Sol (medium)OpenAI97.955.6 tok/s$11.25/M
#11Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropic97.854.3 tok/s$10.00/M
#12GPT-5.6 Terra (max)OpenAI97.8170.1 tok/s$5.63/M
#13Muse Spark 1.1 (xhigh)Meta97.7124.3 tok/s$2.00/M
#14GPT-5.5 (medium)OpenAI97.758.3 tok/s$11.25/M
#15Gemini 3 Pro Preview (high)Google97.3n/a$4.50/M
#16Gemini 3.5 Flash (high)Google97.2241.2 tok/s$3.38/M
#17Claude Opus 4.7 (Adaptive Reasoning, Max Effort)Anthropic96.849.5 tok/s$10.00/M
#18GPT-5.3 Codex (xhigh)OpenAI96.795.4 tok/s$4.81/M
#19Gemini 3.5 Flash (medium)Google96.6234.7 tok/s$3.38/M
#20Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic96.589.2 tok/s$4.00/M
#21GPT-5.6 Terra (xhigh)OpenAI96.0117.6 tok/s$5.63/M
#22GPT-5.6 Luna (max)OpenAI96.0243.6 tok/s$2.25/M
#23GPT-5.6 Sol (low)OpenAI95.757.1 tok/s$11.25/M
#24Kimi K2.6Kimi95.639.2 tok/s$1.71/M
#25GPT-5.2 (xhigh)OpenAI95.480.5 tok/s$4.81/M
#26Gemini 3 Flash Preview (Reasoning)Google95.1197.7 tok/s$1.13/M
#27GPT-5.2 Codex (xhigh)OpenAI95.0125.5 tok/s$4.81/M
#28Qwen3.7 MaxAlibaba94.9198.9 tok/s$3.75/M
#29GLM-5.2 (max)Z AI94.7149.2 tok/s$2.15/M
#30Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic94.549.5 tok/s$10.00/M
#31GPT-4.5 (Preview)OpenAI94.1n/a-
#32Muse SparkMeta94.0n/a-
#33GPT-5.6 Terra (high)OpenAI94.0109.5 tok/s$5.63/M
#34GPT-5.5 (low)OpenAI93.856.8 tok/s$11.25/M
#35Grok Build 0.1 0616SpaceXAI93.746.3 tok/s$1.25/M
#36MiniMax-M3MiniMax93.494.8 tok/s$0.525/M
#37GPT-5.6 Luna (xhigh)OpenAI93.3185.7 tok/s$2.25/M
#38DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek92.863.7 tok/s$0.544/M
#39Grok 4.3 (high)SpaceXAI92.8112.5 tok/s$1.56/M
#40Gemini 3 Pro Preview (low)Google92.7n/a$4.50/M
#41GPT-5.6 Luna (high)OpenAI92.6191.2 tok/s$2.25/M
#42DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek92.157.6 tok/s$0.544/M
#43Kimi K2.7 CodeKimi92.043 tok/s$1.71/M
#44Claude Opus 4.5 (Reasoning)Anthropic91.958.5 tok/s$10.00/M
#45TEHy3Tencent91.748 tok/s-
#46Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic91.643 tok/s$10.00/M
#47Grok 4.20 0309 v2 (Reasoning)SpaceXAI91.5159.2 tok/s$3.00/M
#48MiMo-V2.5-ProXiaomi91.457.1 tok/s$0.544/M
#49Qwen3.7 PlusAlibaba91.152.4 tok/s$0.700/M
#50GPT-5.4 (low)OpenAI90.898.2 tok/s$5.63/M
#51GPT-5.6 Terra (medium)OpenAI90.8103.3 tok/s$5.63/M
#52Kimi K2.5 (Reasoning)Kimi90.546.8 tok/s$1.20/M
#53DeepSeek V4 Flash (Reasoning, Max Effort)DeepSeek90.0101.1 tok/s$0.175/M
#54GPT-5.4 mini (xhigh)OpenAI89.9167.5 tok/s$1.69/M
#55Qwen3.6 Max PreviewAlibaba89.837 tok/s$2.93/M
#56Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic89.572 tok/s$6.00/M
#57Grok 4SpaceXAI89.2n/a$11.00/M
#58MiniMax-M2.7MiniMax89.248.6 tok/s$0.525/M
#59GPT-5.1 (high)OpenAI88.889.9 tok/s$3.44/M
#60TMInkling (xhigh)Thinking Machines88.882.9 tok/s$2.57/M
#61Grok 4.20 0309 (Reasoning)SpaceXAI88.8n/a$3.00/M
#62Grok 4.3 (medium)SpaceXAI88.5107.9 tok/s$1.56/M
#63DeepSeek V3.2 SpecialeDeepSeek88.5n/a-
#64GPT-5.2 (medium)OpenAI88.0n/a$4.81/M
#65NANex-N2-ProNex AGI87.8138.6 tok/s$1.00/M
#66GPT-5 (high)OpenAI87.7102.7 tok/s$3.44/M
#67GPT-5.6 Terra (low)OpenAI87.3102.3 tok/s$5.63/M
#68GLM-4.7 (Reasoning)Z AI87.2101.5 tok/s$1.00/M
#69GLM-5.1 (Reasoning)Z AI86.967.9 tok/s$2.15/M
#70Qwen3.5 397B A17B (Reasoning)Alibaba86.758.2 tok/s$1.35/M
#71MiMo-V2-ProXiaomi86.2n/a-
#72GPT-5.5 Instant (May 2026)OpenAI86.2n/a$11.25/M
#73GLM-5 (Reasoning)Z AI86.246.2 tok/s$1.55/M
#74GPT-5.6 Luna (medium)OpenAI86.1185.8 tok/s$2.25/M
#75DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek85.6n/a$0.175/M
#76Gemini 2.5 ProGoogle85.3127.9 tok/s$3.44/M
#77Qwen3 Max ThinkingAlibaba85.2n/a-
#78GPT-5 (medium)OpenAI85.191.5 tok/s$3.44/M
#79Claude 4.5 Sonnet (Reasoning)Anthropic85.050 tok/s$6.00/M
#80GPT-5 Codex (high)OpenAI84.9167.4 tok/s$3.44/M