Reasoning leaderboard across GPQA, HLE, MMLU-Pro, and related metrics.
Domain score averages relative percentile across included metrics.
Domain score 100
Reasoning leaderboard across GPQA, HLE, MMLU-Pro, and related metrics.
| Rank | Model | Creator | Domain Score | Speed | Blended Price |
|---|---|---|---|---|---|
| #1 | Gemini 3.1 Pro Preview | 99.7 | 123.1 tok/s | $4.50/M | |
| #2 |
| OpenAI |
| 99.6 |
| 67.4 tok/s |
| $11.25/M |
| #3 | Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | Anthropic | 99.4 | 69.4 tok/s | $20.00/M |
| #4 | GPT-5.5 (xhigh) | OpenAI | 99.1 | 73.9 tok/s | $11.25/M |
| #5 | GPT-5.6 Sol (high) | OpenAI | 98.9 | 56.2 tok/s | $11.25/M |
| #6 | GPT-5.6 Sol (xhigh) | OpenAI | 98.9 | 57 tok/s | $11.25/M |
| #7 | GPT-5.5 (high) | OpenAI | 98.7 | 58.4 tok/s | $11.25/M |
| #8 | GPT-5.4 (xhigh) | OpenAI | 98.1 | 154.5 tok/s | $5.63/M |
| #9 | Grok 4.5 (high) | SpaceXAI | 98.0 | 122.8 tok/s | $3.00/M |
| #10 | GPT-5.6 Sol (medium) | OpenAI | 97.9 | 55.6 tok/s | $11.25/M |
| #11 | Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | Anthropic | 97.8 | 54.3 tok/s | $10.00/M |
| #12 | GPT-5.6 Terra (max) | OpenAI | 97.8 | 170.1 tok/s | $5.63/M |
| #13 | Muse Spark 1.1 (xhigh) | Meta | 97.7 | 124.3 tok/s | $2.00/M |
| #14 | GPT-5.5 (medium) | OpenAI | 97.7 | 58.3 tok/s | $11.25/M |
| #15 | Gemini 3 Pro Preview (high) | 97.3 | n/a | $4.50/M |
| #16 | Gemini 3.5 Flash (high) | 97.2 | 241.2 tok/s | $3.38/M |
| #17 | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) | Anthropic | 96.8 | 49.5 tok/s | $10.00/M |
| #18 | GPT-5.3 Codex (xhigh) | OpenAI | 96.7 | 95.4 tok/s | $4.81/M |
| #19 | Gemini 3.5 Flash (medium) | 96.6 | 234.7 tok/s | $3.38/M |
| #20 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | Anthropic | 96.5 | 89.2 tok/s | $4.00/M |
| #21 | GPT-5.6 Terra (xhigh) | OpenAI | 96.0 | 117.6 tok/s | $5.63/M |
| #22 | GPT-5.6 Luna (max) | OpenAI | 96.0 | 243.6 tok/s | $2.25/M |
| #23 | GPT-5.6 Sol (low) | OpenAI | 95.7 | 57.1 tok/s | $11.25/M |
| #24 | Kimi K2.6 | Kimi | 95.6 | 39.2 tok/s | $1.71/M |
| #25 | GPT-5.2 (xhigh) | OpenAI | 95.4 | 80.5 tok/s | $4.81/M |
| #26 | Gemini 3 Flash Preview (Reasoning) | 95.1 | 197.7 tok/s | $1.13/M |
| #27 | GPT-5.2 Codex (xhigh) | OpenAI | 95.0 | 125.5 tok/s | $4.81/M |
| #28 | Qwen3.7 Max | Alibaba | 94.9 | 198.9 tok/s | $3.75/M |
| #29 | GLM-5.2 (max) | Z AI | 94.7 | 149.2 tok/s | $2.15/M |
| #30 | Claude Opus 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 94.5 | 49.5 tok/s | $10.00/M |
| #31 | GPT-4.5 (Preview) | OpenAI | 94.1 | n/a | - |
| #32 | Muse Spark | Meta | 94.0 | n/a | - |
| #33 | GPT-5.6 Terra (high) | OpenAI | 94.0 | 109.5 tok/s | $5.63/M |
| #34 | GPT-5.5 (low) | OpenAI | 93.8 | 56.8 tok/s | $11.25/M |
| #35 | Grok Build 0.1 0616 | SpaceXAI | 93.7 | 46.3 tok/s | $1.25/M |
| #36 | MiniMax-M3 | MiniMax | 93.4 | 94.8 tok/s | $0.525/M |
| #37 | GPT-5.6 Luna (xhigh) | OpenAI | 93.3 | 185.7 tok/s | $2.25/M |
| #38 | DeepSeek V4 Pro (Reasoning, Max Effort) | DeepSeek | 92.8 | 63.7 tok/s | $0.544/M |
| #39 | Grok 4.3 (high) | SpaceXAI | 92.8 | 112.5 tok/s | $1.56/M |
| #40 | Gemini 3 Pro Preview (low) | 92.7 | n/a | $4.50/M |
| #41 | GPT-5.6 Luna (high) | OpenAI | 92.6 | 191.2 tok/s | $2.25/M |
| #42 | DeepSeek V4 Pro (Reasoning, High Effort) | DeepSeek | 92.1 | 57.6 tok/s | $0.544/M |
| #43 | Kimi K2.7 Code | Kimi | 92.0 | 43 tok/s | $1.71/M |
| #44 | Claude Opus 4.5 (Reasoning) | Anthropic | 91.9 | 58.5 tok/s | $10.00/M |
| #45 | Hy3 | Tencent | 91.7 | 48 tok/s | - |
| #46 | Claude Opus 4.7 (Non-reasoning, High Effort) | Anthropic | 91.6 | 43 tok/s | $10.00/M |
| #47 | Grok 4.20 0309 v2 (Reasoning) | SpaceXAI | 91.5 | 159.2 tok/s | $3.00/M |
| #48 | MiMo-V2.5-Pro | Xiaomi | 91.4 | 57.1 tok/s | $0.544/M |
| #49 | Qwen3.7 Plus | Alibaba | 91.1 | 52.4 tok/s | $0.700/M |
| #50 | GPT-5.4 (low) | OpenAI | 90.8 | 98.2 tok/s | $5.63/M |
| #51 | GPT-5.6 Terra (medium) | OpenAI | 90.8 | 103.3 tok/s | $5.63/M |
| #52 | Kimi K2.5 (Reasoning) | Kimi | 90.5 | 46.8 tok/s | $1.20/M |
| #53 | DeepSeek V4 Flash (Reasoning, Max Effort) | DeepSeek | 90.0 | 101.1 tok/s | $0.175/M |
| #54 | GPT-5.4 mini (xhigh) | OpenAI | 89.9 | 167.5 tok/s | $1.69/M |
| #55 | Qwen3.6 Max Preview | Alibaba | 89.8 | 37 tok/s | $2.93/M |
| #56 | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 89.5 | 72 tok/s | $6.00/M |
| #57 | Grok 4 | SpaceXAI | 89.2 | n/a | $11.00/M |
| #58 | MiniMax-M2.7 | MiniMax | 89.2 | 48.6 tok/s | $0.525/M |
| #59 | GPT-5.1 (high) | OpenAI | 88.8 | 89.9 tok/s | $3.44/M |
| #60 | Inkling (xhigh) | Thinking Machines | 88.8 | 82.9 tok/s | $2.57/M |
| #61 | Grok 4.20 0309 (Reasoning) | SpaceXAI | 88.8 | n/a | $3.00/M |
| #62 | Grok 4.3 (medium) | SpaceXAI | 88.5 | 107.9 tok/s | $1.56/M |
| #63 | DeepSeek V3.2 Speciale | DeepSeek | 88.5 | n/a | - |
| #64 | GPT-5.2 (medium) | OpenAI | 88.0 | n/a | $4.81/M |
| #65 | Nex-N2-Pro | Nex AGI | 87.8 | 138.6 tok/s | $1.00/M |
| #66 | GPT-5 (high) | OpenAI | 87.7 | 102.7 tok/s | $3.44/M |
| #67 | GPT-5.6 Terra (low) | OpenAI | 87.3 | 102.3 tok/s | $5.63/M |
| #68 | GLM-4.7 (Reasoning) | Z AI | 87.2 | 101.5 tok/s | $1.00/M |
| #69 | GLM-5.1 (Reasoning) | Z AI | 86.9 | 67.9 tok/s | $2.15/M |
| #70 | Qwen3.5 397B A17B (Reasoning) | Alibaba | 86.7 | 58.2 tok/s | $1.35/M |
| #71 | MiMo-V2-Pro | Xiaomi | 86.2 | n/a | - |
| #72 | GPT-5.5 Instant (May 2026) | OpenAI | 86.2 | n/a | $11.25/M |
| #73 | GLM-5 (Reasoning) | Z AI | 86.2 | 46.2 tok/s | $1.55/M |
| #74 | GPT-5.6 Luna (medium) | OpenAI | 86.1 | 185.8 tok/s | $2.25/M |
| #75 | DeepSeek V4 Flash (Reasoning, High Effort) | DeepSeek | 85.6 | n/a | $0.175/M |
| #76 | Gemini 2.5 Pro | 85.3 | 127.9 tok/s | $3.44/M |
| #77 | Qwen3 Max Thinking | Alibaba | 85.2 | n/a | - |
| #78 | GPT-5 (medium) | OpenAI | 85.1 | 91.5 tok/s | $3.44/M |
| #79 | Claude 4.5 Sonnet (Reasoning) | Anthropic | 85.0 | 50 tok/s | $6.00/M |
| #80 | GPT-5 Codex (high) | OpenAI | 84.9 | 167.4 tok/s | $3.44/M |