Cost leaderboard using input, output, blended price, and value index.
Domain score averages relative percentile across included metrics.
Domain score 99
Cost leaderboard using input, output, blended price, and value index.
| Rank | Model | Creator | Domain Score | Speed | Blended Price |
|---|---|---|---|---|---|
| #1 | Qwen3.5 4B (Non-reasoning) | Alibaba | 98.9 | 23 tok/s | $0.060/M |
| #2 |
| Alibaba |
| 98.8 |
| 22.8 tok/s |
| $0.060/M |
| #3 | HyperNova 60B 2605 | Multiverse Computing | 98.6 | 350.9 tok/s | $0.065/M |
| #4 | Sarvam 30B (high) | Sarvam | 98.2 | 200.7 tok/s | $0.047/M |
| #5 | Granite 4.1 8B | IBM | 96.9 | 117.8 tok/s | $0.063/M |
| #6 | Sarvam 105B (high) | Sarvam | 96.8 | 115.9 tok/s | $0.074/M |
| #7 | gpt-oss-20b (high) | OpenAI | 96.6 | 224.5 tok/s | $0.088/M |
| #8 | NVIDIA Nemotron Nano 9B V2 (Reasoning) | NVIDIA | 96.5 | 85.9 tok/s | $0.070/M |
| #9 | Nova Micro | Amazon | 96.0 | 249.8 tok/s | $0.061/M |
| #10 | NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) | NVIDIA | 95.9 | 111.7 tok/s | $0.088/M |
| #11 | gpt-oss-20b (low) | OpenAI | 95.3 | 260.9 tok/s | $0.095/M |
| #12 | Qwen3.5 9B (Reasoning) | Alibaba | 95.1 | 67.6 tok/s | $0.113/M |
| #13 | NVIDIA Nemotron Nano 9B V2 (Non-reasoning) | NVIDIA | 94.8 | 138.9 tok/s | $0.086/M |
| #14 | Gemma 3n E4B Instruct | 94.6 | 49.7 tok/s | $0.025/M |
| #15 | NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning) | NVIDIA | 94.4 | 99.8 tok/s | $0.088/M |
| #16 | Ministral 3 3B | Mistral | 93.2 | 158.5 tok/s | $0.100/M |
| #17 | Llama 3.1 Instruct 8B | Meta | 93.1 | 155.5 tok/s | $0.100/M |
| #18 | Step 3.5 Flash 2603 | StepFun | 92.7 | 256.9 tok/s | $0.150/M |
| #19 | Qwen2.5 Turbo | Alibaba | 92.6 | 113.6 tok/s | $0.088/M |
| #20 | Gemma 4 12B (Reasoning) | 92.5 | 125.3 tok/s | $0.150/M |
| #21 | Nemotron 3 Nano Omni 30B A3B Reasoning | NVIDIA | 92.4 | 320 tok/s | $0.131/M |
| #22 | GPT-5 nano (medium) | OpenAI | 91.9 | 155.7 tok/s | $0.138/M |
| #23 | GPT-5 nano (high) | OpenAI | 91.8 | 154.5 tok/s | $0.138/M |
| #24 | Gemma 4 12B (Non-reasoning) | 91.5 | 121.2 tok/s | $0.150/M |
| #25 | Nova Lite | Amazon | 91.4 | 147.8 tok/s | $0.105/M |
| #26 | DeepSeek V4 Flash (Reasoning, Max Effort) | DeepSeek | 90.9 | 101.1 tok/s | $0.175/M |
| #27 | DeepSeek V4 Flash (Reasoning, High Effort) | DeepSeek | 90.6 | n/a | $0.175/M |
| #28 | Ling 2.6 Flash | InclusionAI | 90.6 | 172.8 tok/s | $0.150/M |
| #29 | MiMo-V2-Flash (Reasoning) | Xiaomi | 90.5 | n/a | $0.150/M |
| #30 | Step 3.5 Flash | StepFun | 90.5 | 247.4 tok/s | $0.150/M |
| #31 | GLM-4.7-Flash (Reasoning) | Z AI | 90.3 | 83.7 tok/s | $0.153/M |
| #32 | MiMo-V2.5 | Xiaomi | 90.1 | 75.5 tok/s | $0.175/M |
| #33 | Granite 4.0 H Small | IBM | 89.9 | 439.5 tok/s | $0.107/M |
| #34 | DeepSeek V4 Flash (Non-reasoning) | DeepSeek | 89.9 | 90.1 tok/s | $0.175/M |
| #35 | Mistral Small 3.1 | Mistral | 89.7 | 144.9 tok/s | $0.150/M |
| #36 | Llama 2 Chat 7B | Meta | 89.5 | 95.6 tok/s | $0.100/M |
| #37 | GLM-4.7-Flash (Non-reasoning) | Z AI | 89.2 | 122.7 tok/s | $0.153/M |
| #38 | GPT-5 nano (minimal) | OpenAI | 88.7 | 168.7 tok/s | $0.138/M |
| #39 | Ministral 3 8B | Mistral | 88.3 | 89 tok/s | $0.150/M |
| #40 | Mistral Small 3.2 | Mistral | 88.2 | 144.9 tok/s | $0.150/M |
| #41 | Gemma 4 26B A4B (Reasoning) | 88.0 | n/a | $0.198/M |
| #42 | Gemma 4 26B A4B (Non-reasoning) | 87.8 | 70.8 tok/s | $0.198/M |
| #43 | Gemini 2.5 Flash-Lite Preview (Sep '25) (Reasoning) | 87.6 | n/a | $0.175/M |
| #44 | Hy3-preview (Reasoning) | Tencent | 87.3 | 124.1 tok/s | $0.200/M |
| #45 | Gemma 4 31B (Non-reasoning) | 87.2 | 43.7 tok/s | $0.205/M |
| #46 | Devstral Small (Jul '25) | Mistral | 87.0 | n/a | $0.150/M |
| #47 | Hy3-preview (Non-reasoning) | Tencent | 86.4 | 121.5 tok/s | $0.200/M |
| #48 | Gemini 2.5 Flash-Lite Preview (Sep '25) (Non-reasoning) | 86.3 | n/a | $0.175/M |
| #49 | Mistral Small 3 | Mistral | 86.3 | 145.3 tok/s | $0.150/M |
| #50 | Granite 3.3 8B (Non-reasoning) | IBM | 86.2 | 414.9 tok/s | $0.085/M |
| #51 | Gemini 2.5 Flash-Lite (Reasoning) | 86.1 | 237.8 tok/s | $0.175/M |
| #52 | Llama 3 Instruct 8B | Meta | 85.9 | 79.8 tok/s | $0.070/M |
| #53 | GPT-4.1 nano | OpenAI | 85.5 | 148 tok/s | $0.175/M |
| #54 | Solar Mini | Upstage | 85.4 | 78.2 tok/s | $0.150/M |
| #55 | Olmo 3 7B Instruct | Allen Institute for AI | 84.5 | n/a | $0.125/M |
| #56 | Ministral 3 14B | Mistral | 84.2 | 75.5 tok/s | $0.200/M |
| #57 | Llama 3.2 Instruct 3B | Meta | 83.8 | 51.7 tok/s | $0.150/M |
| #58 | Hermes 4 - Llama-3.1 70B (Reasoning) | Nous Research | 83.6 | 92.1 tok/s | $0.198/M |
| #59 | gpt-oss-120b (high) | OpenAI | 83.5 | 231.3 tok/s | $0.262/M |
| #60 | Gemini 2.5 Flash-Lite (Non-reasoning) | 83.3 | 182.3 tok/s | $0.175/M |
| #61 | Qwen3.5 Omni Flash | Alibaba | 82.5 | 227.8 tok/s | $0.275/M |
| #62 | Hermes 4 - Llama-3.1 70B (Non-reasoning) | Nous Research | 82.1 | 96.2 tok/s | $0.198/M |
| #63 | Grok 4 Fast (Reasoning) | SpaceXAI | 82.0 | n/a | $0.275/M |
| #64 | Mistral Small 4 (Reasoning) | Mistral | 81.8 | 166.7 tok/s | $0.262/M |
| #65 | gpt-oss-120b (low) | OpenAI | 80.6 | 296.3 tok/s | $0.262/M |
| #66 | Llama 3.2 Instruct 1B | Meta | 80.5 | 86.4 tok/s | $0.100/M |
| #67 | DeepSeek V3.2 (Reasoning) | DeepSeek | 80.3 | n/a | $0.315/M |
| #68 | Mistral Small 4 (Non-reasoning) | Mistral | 79.8 | 142.1 tok/s | $0.262/M |
| #69 | Ling-flash-2.0 | InclusionAI | 79.8 | 61.8 tok/s | $0.247/M |
| #70 | Grok 4 Fast (Non-reasoning) | SpaceXAI | 79.2 | n/a | $0.275/M |
| #71 | Ring-flash-2.0 | InclusionAI | 79.1 | n/a | $0.247/M |
| #72 | DeepSeek V3.2 (Non-reasoning) | DeepSeek | 79.0 | n/a | $0.315/M |
| #73 | Gemini 2.0 Flash (Feb '25) | 78.8 | n/a | $0.262/M |
| #74 | DeepSeek V3.2 Exp (Reasoning) | DeepSeek | 78.7 | n/a | $0.315/M |
| #75 | Seed-OSS-36B-Instruct | ByteDance Seed | 78.1 | 36.6 tok/s | $0.300/M |
| #76 | DeepSeek V3.2 Exp (Non-reasoning) | DeepSeek | 78.0 | n/a | $0.315/M |
| #77 | Phi-4 | Microsoft | 77.2 | 27 tok/s | $0.219/M |
| #78 | Llama 4 Scout | Meta | 76.8 | 89.6 tok/s | $0.287/M |
| #79 | Apertus 8B Instruct | Swiss AI Initiative | 76.7 | n/a | $0.125/M |
| #80 | Mercury 2 | Inception | 76.3 | 880.1 tok/s | $0.375/M |