Median output tokens generated per second.
Output Speed is an operational performance metric, not an intelligence benchmark. Artificial Analysis defines it as the average number of output tokens received per second after the first token arrives, using OpenAI tokens as the standard unit.
Test type: Hosted endpoint performance measurement. Higher values mean faster streaming after response start.
167 models have this metric.
Current leader: Celeris-1
Project links
Values come from the current Artificial Analysis performance dataset, read from Supabase when configured.
Top models ranked by Speed.
| Rank | Model | Creator | Value | Speed | Blended Price |
|---|---|---|---|---|---|
| #1 | Celeris-1 | Celeris | 2,116.3 tok/s | 2,116.3 tok/s | $3.00/M |
| #2 |
| Inception |
| 937.1 tok/s |
| 937.1 tok/s |
| $0.375/M |
| #3 | Granite 4.0 H Small | IBM | 426 tok/s | 426 tok/s | $0.107/M |
| #4 | HyperNova 60B 2605 | Multiverse Computing | 418.1 tok/s | 418.1 tok/s | $0.065/M |
| #5 | Step 3.7 Flash | StepFun | 394.3 tok/s | 394.3 tok/s | $0.438/M |
| #6 | LFM2.5-VL-1.6B | Liquid AI | 379.7 tok/s | 379.7 tok/s | - |
| #7 | Gemini 3.5 Flash-Lite | 351.2 tok/s | 351.2 tok/s | $0.850/M |
| #8 | LFM2.5-8B-A1B | Liquid AI | 343.4 tok/s | 343.4 tok/s | - |
| #9 | Nemotron 3 Nano Omni 30B A3B Reasoning | NVIDIA | 319.3 tok/s | 319.3 tok/s | $0.131/M |
| #10 | Gemini 3.1 Flash-Lite | 302.4 tok/s | 302.4 tok/s | $0.563/M |
| #11 | Ministral 3 3B | Mistral | 290.8 tok/s | 290.8 tok/s | $0.100/M |
| #12 | Nova Micro | Amazon | 264 tok/s | 264 tok/s | $0.061/M |
| #13 | NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) | NVIDIA | 259.4 tok/s | 259.4 tok/s | $0.088/M |
| #14 | Qwen3.5 Omni Flash | Alibaba | 246.6 tok/s | 246.6 tok/s | $0.275/M |
| #15 | Gemini 3.5 Flash (medium) | 240.9 tok/s | 240.9 tok/s | $3.38/M |
| #16 | NVIDIA Nemotron Nano 9B V2 (Reasoning) | NVIDIA | 234 tok/s | 234 tok/s | $0.070/M |
| #17 | gpt-oss-120b (low) | OpenAI | 229.2 tok/s | 229.2 tok/s | $0.261/M |
| #18 | Gemini 3.5 Flash (minimal) | 223.3 tok/s | 223.3 tok/s | $3.38/M |
| #19 | Gemini 3.5 Flash (high) | 220.6 tok/s | 220.6 tok/s | $3.38/M |
| #20 | NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning) | NVIDIA | 218 tok/s | 218 tok/s | $0.088/M |
| #21 | Nova 2.0 Lite (Non-reasoning) | Amazon | 217.7 tok/s | 217.7 tok/s | $0.850/M |
| #22 | Gemini 3.6 Flash (high) | 214.8 tok/s | 214.8 tok/s | $3.00/M |
| #23 | Trinity Large Thinking | Arcee AI | 206 tok/s | 206 tok/s | $0.395/M |
| #24 | Qwen3.7 Max | Alibaba | 202 tok/s | 202 tok/s | $3.75/M |
| #25 | Qwen3 Next 80B A3B (Reasoning) | Alibaba | 201.9 tok/s | 201.9 tok/s | $1.88/M |
| #26 | Nova 2.0 Lite (medium) | Amazon | 199.6 tok/s | 199.6 tok/s | $0.850/M |
| #27 | Nemotron 3 Ultra 550B A55B (Reasoning) | NVIDIA | 199.6 tok/s | 199.6 tok/s | $1.18/M |
| #28 | Command A+ | Cohere | 195.8 tok/s | 195.8 tok/s | - |
| #29 | gpt-oss-20b (low) | OpenAI | 195.1 tok/s | 195.1 tok/s | $0.109/M |
| #30 | Qwen3 Next 80B A3B Instruct | Alibaba | 194.4 tok/s | 194.4 tok/s | $0.875/M |
| #31 | gpt-oss-120b (high) | OpenAI | 193.7 tok/s | 193.7 tok/s | $0.262/M |
| #32 | Nova 2.0 Lite (high) | Amazon | 190.3 tok/s | 190.3 tok/s | $0.850/M |
| #33 | gpt-oss-20b (high) | OpenAI | 185.1 tok/s | 185.1 tok/s | $0.103/M |
| #34 | Nova 2.0 Lite (low) | Amazon | 184.1 tok/s | 184.1 tok/s | $0.850/M |
| #35 | NVIDIA Nemotron Nano 9B V2 (Non-reasoning) | NVIDIA | 176.5 tok/s | 176.5 tok/s | $0.086/M |
| #36 | Qwen3.5 35B A3B (Non-reasoning) | Alibaba | 175.9 tok/s | 175.9 tok/s | $0.688/M |
| #37 | GPT-5.6 Luna (max) | OpenAI | 174.2 tok/s | 174.2 tok/s | $0.450/M |
| #38 | GPT-5.6 Luna (xhigh) | OpenAI | 174 tok/s | 174 tok/s | $0.450/M |
| #39 | GPT-5.6 Luna (high) | OpenAI | 172.1 tok/s | 172.1 tok/s | $0.450/M |
| #40 | GPT-5.6 Luna (Non-reasoning) | OpenAI | 165.6 tok/s | 165.6 tok/s | $0.450/M |
| #41 | GPT-5.6 Luna (low) | OpenAI | 161.6 tok/s | 161.6 tok/s | $0.450/M |
| #42 | NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning) | NVIDIA | 159.7 tok/s | 159.7 tok/s | $0.300/M |
| #43 | GPT-5.6 Luna (medium) | OpenAI | 158.4 tok/s | 158.4 tok/s | $0.450/M |
| #44 | Qwen3.5 122B A10B (Non-reasoning) | Alibaba | 154.5 tok/s | 154.5 tok/s | $1.10/M |
| #45 | Mistral Small 4 (Non-reasoning) | Mistral | 151.7 tok/s | 151.7 tok/s | $0.262/M |
| #46 | Nova 2.0 Pro Preview (low) | Amazon | 151.3 tok/s | 151.3 tok/s | $3.44/M |
| #47 | Mistral Small 4 (Reasoning) | Mistral | 149.9 tok/s | 149.9 tok/s | $0.262/M |
| #48 | NVIDIA Nemotron 3 Super 120B A12B (Reasoning) | NVIDIA | 146.6 tok/s | 146.6 tok/s | $0.350/M |
| #49 | Hy3-preview (Reasoning) | Tencent | 145 tok/s | 145 tok/s | $0.107/M |
| #50 | Claude 4.5 Haiku (Reasoning) | Anthropic | 142.4 tok/s | 142.4 tok/s | $2.00/M |
| #51 | o3 | OpenAI | 140.1 tok/s | 140.1 tok/s | $3.50/M |
| #52 | Muse Spark 1.1 (xhigh) | Meta | 139.7 tok/s | 139.7 tok/s | $2.00/M |
| #53 | Qwen3.5 122B A10B (Reasoning) | Alibaba | 138.3 tok/s | 138.3 tok/s | $1.10/M |
| #54 | Grok 4.3 (low) | SpaceXAI | 137.5 tok/s | 137.5 tok/s | $1.56/M |
| #55 | Nova 2.0 Pro Preview (medium) | Amazon | 136.2 tok/s | 136.2 tok/s | $3.44/M |
| #56 | Qwen3.6 35B A3B (Reasoning) | Alibaba | 134.4 tok/s | 134.4 tok/s | $0.557/M |
| #57 | Gemini 3.1 Pro Preview | 134.1 tok/s | 134.1 tok/s | $4.50/M |
| #58 | GPT-5.6 Terra (max) | OpenAI | 132 tok/s | 132 tok/s | $4.50/M |
| #59 | Nex-N2-Pro | Nex AGI | 132 tok/s | 132 tok/s | $1.00/M |
| #60 | Gemini 2.5 Pro | 130.8 tok/s | 130.8 tok/s | $3.44/M |
| #61 | Grok 4.3 (Non-reasoning) | SpaceXAI | 130.4 tok/s | 130.4 tok/s | $1.56/M |
| #62 | Grok 4.3 (medium) | SpaceXAI | 129.8 tok/s | 129.8 tok/s | $1.56/M |
| #63 | Tiny Aya Global | Cohere | 128.8 tok/s | 128.8 tok/s | - |
| #64 | Agnes 2.5 Pro Alpha | Sapiens AI | 127.2 tok/s | 127.2 tok/s | $0.563/M |
| #65 | Qwen3 Coder Next | Alibaba | 126.8 tok/s | 126.8 tok/s | $0.563/M |
| #66 | Ring-2.6-1T | InclusionAI | 125.7 tok/s | 125.7 tok/s | $0.850/M |
| #67 | Nova 2.0 Pro Preview (Non-reasoning) | Amazon | 124.2 tok/s | 124.2 tok/s | $3.44/M |
| #68 | GPT-5.6 Terra (high) | OpenAI | 117.9 tok/s | 117.9 tok/s | $4.50/M |
| #69 | GPT-5.6 Terra (low) | OpenAI | 115.7 tok/s | 115.7 tok/s | $4.50/M |
| #70 | Granite 4.1 8B | IBM | 114.9 tok/s | 114.9 tok/s | $0.063/M |
| #71 | GPT-5.6 Terra (medium) | OpenAI | 111.6 tok/s | 111.6 tok/s | $4.50/M |
| #72 | GPT-5.6 Terra (xhigh) | OpenAI | 109.7 tok/s | 109.7 tok/s | $4.50/M |
| #73 | GPT-5.3 Codex (xhigh) | OpenAI | 109.1 tok/s | 109.1 tok/s | $4.81/M |
| #74 | Hy3-preview (Non-reasoning) | Tencent | 108.8 tok/s | 108.8 tok/s | $0.107/M |
| #75 | DeepSeek V4 Flash (Non-reasoning) | DeepSeek | 108.7 tok/s | 108.7 tok/s | $0.175/M |
| #76 | Qwen3 Omni 30B A3B (Reasoning) | Alibaba | 108.3 tok/s | 108.3 tok/s | $0.430/M |
| #77 | Qwen3 Omni 30B A3B Instruct | Alibaba | 107.9 tok/s | 107.9 tok/s | $0.430/M |
| #78 | GPT-5.6 Terra (Non-reasoning) | OpenAI | 107.1 tok/s | 107.1 tok/s | $4.50/M |
| #79 | DeepSeek V4 Flash (Reasoning, Max Effort) | DeepSeek | 106.7 tok/s | 106.7 tok/s | $0.175/M |
| #80 | Ministral 3 8B | Mistral | 105.6 tok/s | 105.6 tok/s | $0.150/M |