Runtime leaderboard using output speed and latency.
Domain score averages relative percentile across included metrics.
Domain score 98
Runtime leaderboard using output speed and latency.
| Rank | Model | Creator | Domain Score | Speed | Blended Price |
|---|---|---|---|---|---|
| #1 | NVIDIA Nemotron Nano 12B v2 VL (Reasoning) | NVIDIA | 97.9 | 282.5 tok/s | $0.300/M |
| #2 | Command A+ | Cohere | 94.4 | 191 tok/s | - |
| #3 |
| OpenAI |
| 93.9 |
| 260.9 tok/s |
| $0.095/M |
| #4 | gpt-oss-20b (high) | OpenAI | 93.6 | 224.5 tok/s | $0.088/M |
| #5 | gpt-oss-120b (low) | OpenAI | 92.8 | 296.3 tok/s | $0.262/M |
| #6 | Nemotron 3 Nano Omni 30B A3B Reasoning | NVIDIA | 92.7 | 320 tok/s | $0.131/M |
| #7 | Gemini 2.5 Flash-Lite (Non-reasoning) | 92.5 | 182.3 tok/s | $0.175/M |
| #8 | Gemini 2.5 Flash (Non-reasoning) | 90.7 | 188.7 tok/s | $0.850/M |
| #9 | gpt-oss-120b (high) | OpenAI | 89.6 | 231.3 tok/s | $0.262/M |
| #10 | Nova Micro | Amazon | 89.1 | 249.8 tok/s | $0.061/M |
| #11 | GPT-4o (Nov '24) | OpenAI | 88.2 | 181.2 tok/s | $4.38/M |
| #12 | HyperNova 60B 2605 | Multiverse Computing | 87.9 | 350.9 tok/s | $0.065/M |
| #13 | Ministral 3 3B | Mistral | 87.7 | 158.5 tok/s | $0.100/M |
| #14 | Step 3.7 Flash | StepFun | 87.1 | 385.2 tok/s | $0.438/M |
| #15 | GPT-5.4 nano (Non-Reasoning) | OpenAI | 86.9 | 170.4 tok/s | $0.463/M |
| #16 | Tiny Aya Global | Cohere | 84.8 | 133.5 tok/s | - |
| #17 | GPT-4.1 nano | OpenAI | 84.8 | 148 tok/s | $0.175/M |
| #18 | Mistral Small 3.2 | Mistral | 84.8 | 144.9 tok/s | $0.150/M |
| #19 | Llama 3.1 Instruct 8B | Meta | 84.7 | 155.5 tok/s | $0.100/M |
| #20 | Step 3.5 Flash | StepFun | 83.7 | 247.4 tok/s | $0.150/M |
| #21 | Step 3.5 Flash 2603 | StepFun | 83.4 | 256.9 tok/s | $0.150/M |
| #22 | GPT-5 (ChatGPT) | OpenAI | 82.9 | 158.5 tok/s | $3.44/M |
| #23 | GPT-5.6 Luna (Non-reasoning) | OpenAI | 82.4 | 163.5 tok/s | $2.25/M |
| #24 | Mistral Small 4 (Reasoning) | Mistral | 82.4 | 166.7 tok/s | $0.262/M |
| #25 | Mistral Small 3.1 | Mistral | 82.1 | 144.9 tok/s | $0.150/M |
| #26 | Grok 4.20 0309 v2 (Non-reasoning) | SpaceXAI | 82.1 | 140.6 tok/s | $3.00/M |
| #27 | NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning) | NVIDIA | 81.2 | 224.5 tok/s | $0.300/M |
| #28 | Mistral Small (Feb '24) | Mistral | 81.2 | 142.2 tok/s | $1.50/M |
| #29 | GPT-5.4 mini (Non-Reasoning) | OpenAI | 81.2 | 155.1 tok/s | $1.69/M |
| #30 | Mistral Small 4 (Non-reasoning) | Mistral | 80.7 | 142.1 tok/s | $0.262/M |
| #31 | Ling 2.6 Flash | InclusionAI | 80.4 | 172.8 tok/s | $0.150/M |
| #32 | Gemini 3.5 Flash (minimal) | 79.9 | 201.4 tok/s | $3.38/M |
| #33 | Nova 2.0 Lite (Non-reasoning) | Amazon | 79.9 | 206.7 tok/s | $0.850/M |
| #34 | Gemini 3 Flash Preview (Non-reasoning) | 79.9 | 195.8 tok/s | $1.13/M |
| #35 | Trinity Large Thinking | Arcee AI | 79.6 | 179.7 tok/s | $0.395/M |
| #36 | Nova Lite | Amazon | 79.6 | 147.8 tok/s | $0.105/M |
| #37 | GPT-5 nano (minimal) | OpenAI | 79.4 | 168.7 tok/s | $0.138/M |
| #38 | Granite 4.1 8B | IBM | 78.4 | 117.8 tok/s | $0.063/M |
| #39 | Jamba 1.6 Mini | AI21 Labs | 78.4 | 179.6 tok/s | $0.250/M |
| #40 | Mistral Small (Sep '24) | Mistral | 76.7 | 144.6 tok/s | $0.300/M |
| #41 | Qwen3.5 Omni Flash | Alibaba | 76.7 | 227.8 tok/s | $0.275/M |
| #42 | Mistral Small 3 | Mistral | 75.6 | 145.3 tok/s | $0.150/M |
| #43 | NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning) | NVIDIA | 74.9 | 99.8 tok/s | $0.088/M |
| #44 | Cogito v2.1 (Reasoning) | Deep Cogito | 74.9 | 96.6 tok/s | $1.25/M |
| #45 | Nemotron 3 Ultra 550B A55B (Reasoning) | NVIDIA | 74.6 | 181.6 tok/s | $1.18/M |
| #46 | Qwen3 Next 80B A3B Instruct | Alibaba | 71.7 | 180.8 tok/s | $0.875/M |
| #47 | North Mini Code | Cohere | 71.1 | 81.4 tok/s | - |
| #48 | GPT-4o (Aug '24) | OpenAI | 70.8 | 99.6 tok/s | $4.38/M |
| #49 | GLM-5.2 (max) | Z AI | 70.3 | 149.2 tok/s | $2.15/M |
| #50 | Ministral 3 8B | Mistral | 69.8 | 89 tok/s | $0.150/M |
| #51 | LFM2.5-VL-1.6B | Liquid AI | 69.5 | 392.7 tok/s | - |
| #52 | Qwen3 Next 80B A3B (Reasoning) | Alibaba | 69.3 | 174.8 tok/s | $1.88/M |
| #53 | GPT-3.5 Turbo | OpenAI | 69.3 | 137.2 tok/s | $0.750/M |
| #54 | Mistral 7B Instruct | Mistral | 69.3 | 91.5 tok/s | $0.250/M |
| #55 | Nova 2.0 Pro Preview (Non-reasoning) | Amazon | 68.7 | 120.2 tok/s | $3.44/M |
| #56 | Kimi K2 Thinking | Kimi | 68.5 | 131 tok/s | $1.08/M |
| #57 | Sarvam 30B (high) | Sarvam | 68.2 | 200.7 tok/s | $0.047/M |
| #58 | Magistral Small 1.2 | Mistral | 67.9 | 83.2 tok/s | $0.750/M |
| #59 | GPT-5.6 Terra (Non-reasoning) | OpenAI | 67.6 | 101.7 tok/s | $5.63/M |
| #60 | Nex-N2-Pro | Nex AGI | 67.6 | 138.6 tok/s | $1.00/M |
| #61 | Hermes 4 - Llama-3.1 70B (Non-reasoning) | Nous Research | 67.1 | 96.2 tok/s | $0.198/M |
| #62 | Qwen3 30B A3B 2507 Instruct | Alibaba | 67.1 | 142.3 tok/s | $0.350/M |
| #63 | Llama 4 Maverick | Meta | 66.6 | 98.3 tok/s | $0.475/M |
| #64 | Muse Spark 1.1 (xhigh) | Meta | 66.5 | 124.3 tok/s | $2.00/M |
| #65 | NVIDIA Nemotron 3 Super 120B A12B (Reasoning) | NVIDIA | 66.5 | 145.9 tok/s | $0.381/M |
| #66 | Llama 3.2 Instruct 1B | Meta | 66.5 | 86.4 tok/s | $0.100/M |
| #67 | Llama 3 Instruct 8B | Meta | 66.0 | 79.8 tok/s | $0.070/M |
| #68 | Hermes 4 - Llama-3.1 70B (Reasoning) | Nous Research | 65.8 | 92.1 tok/s | $0.198/M |
| #69 | GPT-4o (May '24) | OpenAI | 65.8 | 94.7 tok/s | $7.50/M |
| #70 | Mistral Medium 3.1 | Mistral | 65.8 | 83.6 tok/s | $0.800/M |
| #71 | Qwen3.5 122B A10B (Non-reasoning) | Alibaba | 65.7 | 145.4 tok/s | $1.10/M |
| #72 | Ministral 3 14B | Mistral | 65.3 | 75.5 tok/s | $0.200/M |
| #73 | Qwen3 30B A3B 2507 (Reasoning) | Alibaba | 65.2 | 143.8 tok/s | $0.750/M |
| #74 | Llama 4 Scout | Meta | 64.9 | 89.6 tok/s | $0.287/M |
| #75 | GPT-5 mini (minimal) | OpenAI | 64.7 | 101.3 tok/s | $0.688/M |
| #76 | GPT-5.4 (Non-reasoning) | OpenAI | 64.4 | 97.5 tok/s | $5.63/M |
| #77 | GPT-4.1 | OpenAI | 64.2 | 90 tok/s | $3.50/M |
| #78 | GLM-4.7-Flash (Non-reasoning) | Z AI | 64.1 | 122.7 tok/s | $0.153/M |
| #79 | Llama 3.3 Instruct 70B | Meta | 63.7 | 87.6 tok/s | $0.612/M |
| #80 | GPT-5.6 Luna (low) | OpenAI | 63.6 | 170.7 tok/s | $2.25/M |