Math leaderboard from math-specific benchmark metrics.
Domain score averages relative percentile across included metrics.
Domain score 100
Math leaderboard from math-specific benchmark metrics.
| Rank | Model | Creator | Domain Score | Speed | Blended Price |
|---|---|---|---|---|---|
| #1 | GPT-5.6 Sol (max) | OpenAI | 100.0 | 67.4 tok/s | $11.25/M |
| #2 |
| OpenAI |
| 100.0 |
| 80.5 tok/s |
| $4.81/M |
| #3 | GPT-5 Codex (high) | OpenAI | 99.6 | 167.4 tok/s | $3.44/M |
| #4 | Gemini 3 Flash Preview (Reasoning) | 99.3 | 197.7 tok/s | $1.13/M |
| #5 | GPT-5.2 (medium) | OpenAI | 98.9 | n/a | $4.81/M |
| #6 | GPT-5 (high) | OpenAI | 98.5 | 102.7 tok/s | $3.44/M |
| #7 | DeepSeek V3.2 Speciale | DeepSeek | 98.5 | n/a | - |
| #8 | MiMo-V2-Flash (Reasoning) | Xiaomi | 98.1 | n/a | $0.150/M |
| #9 | GPT-5.1 Codex (high) | OpenAI | 97.8 | 173.3 tok/s | $3.44/M |
| #10 | Gemini 3 Pro Preview (high) | 97.4 | n/a | $4.50/M |
| #11 | Grok 4 | SpaceXAI | 97.1 | n/a | $11.00/M |
| #12 | GLM-4.7 (Reasoning) | Z AI | 97.0 | 101.5 tok/s | $1.00/M |
| #13 | KAT-Coder-Pro V1 | KwaiKAT | 96.6 | n/a | - |
| #14 | GPT-5 (medium) | OpenAI | 96.5 | 91.5 tok/s | $3.44/M |
| #15 | Kimi K2 Thinking | Kimi | 96.3 | 131 tok/s | $1.08/M |
| #16 | Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | Anthropic | 96.0 | 69.4 tok/s | $20.00/M |
| #17 | o4-mini (high) | OpenAI | 95.9 | 162.3 tok/s | $1.93/M |
| #18 | Nova 2.0 Lite (high) | Amazon | 95.9 | 182.5 tok/s | $0.850/M |
| #19 | Qwen3 235B A22B 2507 (Reasoning) | Alibaba | 95.2 | 58.3 tok/s | $2.63/M |
| #20 | GPT-5.1 (high) | OpenAI | 95.1 | 89.9 tok/s | $3.44/M |
| #21 | gpt-oss-120b (high) | OpenAI | 94.8 | 231.3 tok/s | $0.262/M |
| #22 | o3 | OpenAI | 94.4 | 116.6 tok/s | $3.50/M |
| #23 | o3-mini (high) | OpenAI | 94.4 | 221.6 tok/s | $1.93/M |
| #24 | DeepSeek V3.2 (Reasoning) | DeepSeek | 94.0 | n/a | $0.315/M |
| #25 | Gemini 2.5 Pro Preview (May' 25) | 93.6 | n/a | $3.44/M |
| #26 | GPT-5.1 Codex mini (high) | OpenAI | 93.3 | 203.4 tok/s | $0.688/M |
| #27 | Gemini 2.5 Pro Preview (Mar' 25) | 93.2 | n/a | - |
| #28 | Grok 3 mini Reasoning (high) | SpaceXAI | 93.1 | 45.7 tok/s | $0.350/M |
| #29 | Claude Opus 4.5 (Reasoning) | Anthropic | 92.9 | 58.5 tok/s | $10.00/M |
| #30 | NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) | NVIDIA | 92.5 | 111.7 tok/s | $0.088/M |
| #31 | Gemini 2.5 Flash Preview (Reasoning) | 92.1 | n/a | - |
| #32 | GPT-5.5 (xhigh) | OpenAI | 92.0 | 73.9 tok/s | $11.25/M |
| #33 | GPT-5 mini (high) | OpenAI | 91.4 | 96.9 tok/s | $0.688/M |
| #34 | K-EXAONE (Reasoning) | LG AI Research | 91.0 | n/a | - |
| #35 | Nova 2.0 Omni (medium) | Amazon | 90.7 | n/a | $0.850/M |
| #36 | DeepSeek V3.1 Terminus (Reasoning) | DeepSeek | 90.3 | n/a | $1.91/M |
| #37 | DeepSeek V3.1 (Reasoning) | DeepSeek | 89.9 | n/a | $0.865/M |
| #38 | Grok 4 Fast (Reasoning) | SpaceXAI | 89.6 | n/a | $0.275/M |
| #39 | gpt-oss-20b (high) | OpenAI | 89.2 | 224.5 tok/s | $0.088/M |
| #40 | Gemini 2.5 Pro | 88.9 | 127.9 tok/s | $3.44/M |
| #41 | GPT-5 (low) | OpenAI | 88.8 | 83.9 tok/s | $3.44/M |
| #42 | Grok 4.1 Fast (Reasoning) | SpaceXAI | 88.8 | n/a | - |
| #43 | Ring-1T | InclusionAI | 88.4 | n/a | - |
| #44 | Nova 2.0 Pro Preview (medium) | Amazon | 88.1 | 129.7 tok/s | $3.44/M |
| #45 | GPT-5.6 Sol (xhigh) | OpenAI | 88.0 | 57 tok/s | $11.25/M |
| #46 | Nova 2.0 Lite (medium) | Amazon | 87.7 | 176.8 tok/s | $0.850/M |
| #47 | o3-mini | OpenAI | 87.5 | 210.5 tok/s | $1.93/M |
| #48 | DeepSeek R1 0528 (May '25) | DeepSeek | 87.0 | n/a | $2.06/M |
| #49 | Qwen3 VL 235B A22B (Reasoning) | Alibaba | 86.9 | 58.3 tok/s | $2.63/M |
| #50 | Llama Nemotron Super 49B v1.5 (Reasoning) | NVIDIA | 86.8 | 51.8 tok/s | $0.400/M |
| #51 | INTELLECT-3 | Prime Intellect | 86.6 | n/a | - |
| #52 | Apriel-v1.6-15B-Thinker | ServiceNow | 86.2 | n/a | - |
| #53 | Claude 4.5 Sonnet (Reasoning) | Anthropic | 85.8 | 50 tok/s | $6.00/M |
| #54 | EXAONE 4.0 32B (Reasoning) | LG AI Research | 85.7 | n/a | - |
| #55 | DeepSeek V3.2 Exp (Reasoning) | DeepSeek | 85.1 | n/a | $0.315/M |
| #56 | Claude 4 Sonnet (Reasoning) | Anthropic | 85.1 | n/a | $6.00/M |
| #57 | Sonar Reasoning Pro | Perplexity | 84.8 | n/a | - |
| #58 | GLM-4.5 (Reasoning) | Z AI | 84.8 | n/a | - |
| #59 | Apriel-v1.5-15B-Thinker | ServiceNow | 84.7 | n/a | - |
| #60 | o1 | OpenAI | 84.7 | 131.8 tok/s | $26.25/M |
| #61 | Gemini 3 Pro Preview (low) | 84.3 | n/a | $4.50/M |
| #62 | Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | Anthropic | 84.0 | 54.3 tok/s | $10.00/M |
| #63 | GLM-4.6 (Reasoning) | Z AI | 84.0 | 36.9 tok/s | $0.963/M |
| #64 | Gemini 2.5 Flash (Reasoning) | 83.8 | 219.1 tok/s | $0.850/M |
| #65 | GLM-4.6V (Reasoning) | Z AI | 83.6 | 39.8 tok/s | $0.450/M |
| #66 | ERNIE 5.0 Thinking Preview | Baidu | 83.2 | n/a | - |
| #67 | GPT-5 mini (medium) | OpenAI | 82.8 | 92.8 tok/s | $0.688/M |
| #68 | Claude 4 Opus (Reasoning) | Anthropic | 82.3 | n/a | $30.00/M |
| #69 | Qwen3 VL 32B (Reasoning) | Alibaba | 82.1 | 95.5 tok/s | $2.63/M |
| #70 | Seed-OSS-36B-Instruct | ByteDance Seed | 81.7 | 36.6 tok/s | $0.300/M |
| #71 | Qwen3 Next 80B A3B (Reasoning) | Alibaba | 81.3 | 174.8 tok/s | $1.88/M |
| #72 | Claude 4.5 Haiku (Reasoning) | Anthropic | 81.0 | 117.9 tok/s | $2.00/M |
| #73 | Ring-flash-2.0 | InclusionAI | 80.6 | n/a | $0.247/M |
| #74 | R1 1776 | Perplexity | 80.5 | n/a | - |
| #75 | MiniMax M1 80k | MiniMax | 80.4 | n/a | $0.963/M |
| #76 | GPT-5 nano (high) | OpenAI | 80.2 | 154.5 tok/s | $0.138/M |
| #77 | GPT-5.5 (high) | OpenAI | 80.0 | 58.4 tok/s | $11.25/M |
| #78 | Qwen3 30B A3B 2507 (Reasoning) | Alibaba | 79.8 | 143.8 tok/s | $0.750/M |
| #79 | Qwen3 235B A22B (Reasoning) | Alibaba | 79.8 | 64 tok/s | $2.63/M |
| #80 | Qwen3 32B (Reasoning) | Alibaba | 79.7 | 100.9 tok/s | $2.63/M |