Median output tokens generated per second.
Output Speed is an operational performance metric, not an intelligence benchmark. Artificial Analysis defines it as the average number of output tokens received per second after the first token arrives, using OpenAI tokens as the standard unit.
Test type: Hosted endpoint performance measurement. Higher values mean faster streaming after response start.
314 models have this metric.
Current leader: Mercury 2
Project links
Values come from the current Artificial Analysis performance dataset, read from Supabase when configured.
Top models ranked by Speed.
| Rank | Model | Creator | Value | Speed | Blended Price |
|---|---|---|---|---|---|
| #1 | Mercury 2 | Inception | 880.1 tok/s | 880.1 tok/s | $0.375/M |
| #2 |
| IBM |
| 439.5 tok/s |
| 439.5 tok/s |
| $0.107/M |
| #3 | Granite 3.3 8B (Non-reasoning) | IBM | 414.9 tok/s | 414.9 tok/s | $0.085/M |
| #4 | LFM2.5-VL-1.6B | Liquid AI | 392.7 tok/s | 392.7 tok/s | - |
| #5 | Step 3.7 Flash | StepFun | 385.2 tok/s | 385.2 tok/s | $0.438/M |
| #6 | HyperNova 60B 2605 | Multiverse Computing | 350.9 tok/s | 350.9 tok/s | $0.065/M |
| #7 | LFM2.5-8B-A1B | Liquid AI | 343.4 tok/s | 343.4 tok/s | - |
| #8 | Nemotron 3 Nano Omni 30B A3B Reasoning | NVIDIA | 320 tok/s | 320 tok/s | $0.131/M |
| #9 | gpt-oss-120b (low) | OpenAI | 296.3 tok/s | 296.3 tok/s | $0.262/M |
| #10 | Gemini 3.1 Flash-Lite | 291.6 tok/s | 291.6 tok/s | $0.563/M |
| #11 | Llama 3.1 Nemotron Instruct 70B | NVIDIA | 286.3 tok/s | 286.3 tok/s | $1.20/M |
| #12 | NVIDIA Nemotron Nano 12B v2 VL (Reasoning) | NVIDIA | 282.5 tok/s | 282.5 tok/s | $0.300/M |
| #13 | gpt-oss-20b (low) | OpenAI | 260.9 tok/s | 260.9 tok/s | $0.095/M |
| #14 | Step 3.5 Flash 2603 | StepFun | 256.9 tok/s | 256.9 tok/s | $0.150/M |
| #15 | Nova Micro | Amazon | 249.8 tok/s | 249.8 tok/s | $0.061/M |
| #16 | Step 3.5 Flash | StepFun | 247.4 tok/s | 247.4 tok/s | $0.150/M |
| #17 | GPT-5.6 Luna (max) | OpenAI | 243.6 tok/s | 243.6 tok/s | $2.25/M |
| #18 | Gemini 3.5 Flash (high) | 241.2 tok/s | 241.2 tok/s | $3.38/M |
| #19 | Gemini 2.5 Flash-Lite (Reasoning) | 237.8 tok/s | 237.8 tok/s | $0.175/M |
| #20 | Gemini 3.5 Flash (medium) | 234.7 tok/s | 234.7 tok/s | $3.38/M |
| #21 | gpt-oss-120b (high) | OpenAI | 231.3 tok/s | 231.3 tok/s | $0.262/M |
| #22 | Qwen3.5 Omni Flash | Alibaba | 227.8 tok/s | 227.8 tok/s | $0.275/M |
| #23 | gpt-oss-20b (high) | OpenAI | 224.5 tok/s | 224.5 tok/s | $0.088/M |
| #24 | NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning) | NVIDIA | 224.5 tok/s | 224.5 tok/s | $0.300/M |
| #25 | o3-mini (high) | OpenAI | 221.6 tok/s | 221.6 tok/s | $1.93/M |
| #26 | Gemini 2.5 Flash (Reasoning) | 219.1 tok/s | 219.1 tok/s | $0.850/M |
| #27 | o3-mini | OpenAI | 210.5 tok/s | 210.5 tok/s | $1.93/M |
| #28 | Nova 2.0 Lite (Non-reasoning) | Amazon | 206.7 tok/s | 206.7 tok/s | $0.850/M |
| #29 | GPT-5.1 Codex mini (high) | OpenAI | 203.4 tok/s | 203.4 tok/s | $0.688/M |
| #30 | Gemini 3.5 Flash (minimal) | 201.4 tok/s | 201.4 tok/s | $3.38/M |
| #31 | Sarvam 30B (high) | Sarvam | 200.7 tok/s | 200.7 tok/s | $0.047/M |
| #32 | Qwen3.7 Max | Alibaba | 198.9 tok/s | 198.9 tok/s | $3.75/M |
| #33 | Gemini 3 Flash Preview (Reasoning) | 197.7 tok/s | 197.7 tok/s | $1.13/M |
| #34 | Gemini 3 Flash Preview (Non-reasoning) | 195.8 tok/s | 195.8 tok/s | $1.13/M |
| #35 | GPT-5.6 Luna (high) | OpenAI | 191.2 tok/s | 191.2 tok/s | $2.25/M |
| #36 | Command A+ | Cohere | 191 tok/s | 191 tok/s | - |
| #37 | Gemini 2.5 Flash (Non-reasoning) | 188.7 tok/s | 188.7 tok/s | $0.850/M |
| #38 | GPT-5.6 Luna (medium) | OpenAI | 185.8 tok/s | 185.8 tok/s | $2.25/M |
| #39 | Nova 2.0 Lite (low) | Amazon | 185.7 tok/s | 185.7 tok/s | $0.850/M |
| #40 | GPT-5.6 Luna (xhigh) | OpenAI | 185.7 tok/s | 185.7 tok/s | $2.25/M |
| #41 | Nova 2.0 Lite (high) | Amazon | 182.5 tok/s | 182.5 tok/s | $0.850/M |
| #42 | Gemini 2.5 Flash-Lite (Non-reasoning) | 182.3 tok/s | 182.3 tok/s | $0.175/M |
| #43 | Nemotron 3 Ultra 550B A55B (Reasoning) | NVIDIA | 181.6 tok/s | 181.6 tok/s | $1.18/M |
| #44 | GPT-4o (Nov '24) | OpenAI | 181.2 tok/s | 181.2 tok/s | $4.38/M |
| #45 | Qwen3 Next 80B A3B Instruct | Alibaba | 180.8 tok/s | 180.8 tok/s | $0.875/M |
| #46 | Trinity Large Thinking | Arcee AI | 179.7 tok/s | 179.7 tok/s | $0.395/M |
| #47 | Jamba 1.6 Mini | AI21 Labs | 179.6 tok/s | 179.6 tok/s | $0.250/M |
| #48 | Nova 2.0 Lite (medium) | Amazon | 176.8 tok/s | 176.8 tok/s | $0.850/M |
| #49 | GPT-5.4 mini (medium) | OpenAI | 175.8 tok/s | 175.8 tok/s | $1.69/M |
| #50 | Qwen3 Next 80B A3B (Reasoning) | Alibaba | 174.8 tok/s | 174.8 tok/s | $1.88/M |
| #51 | GPT-5.1 Codex (high) | OpenAI | 173.3 tok/s | 173.3 tok/s | $3.44/M |
| #52 | Ling 2.6 Flash | InclusionAI | 172.8 tok/s | 172.8 tok/s | $0.150/M |
| #53 | GPT-5.6 Luna (low) | OpenAI | 170.7 tok/s | 170.7 tok/s | $2.25/M |
| #54 | GPT-5.4 nano (Non-Reasoning) | OpenAI | 170.4 tok/s | 170.4 tok/s | $0.463/M |
| #55 | GPT-5.6 Terra (max) | OpenAI | 170.1 tok/s | 170.1 tok/s | $5.63/M |
| #56 | GPT-5 nano (minimal) | OpenAI | 168.7 tok/s | 168.7 tok/s | $0.138/M |
| #57 | GPT-5.4 mini (xhigh) | OpenAI | 167.5 tok/s | 167.5 tok/s | $1.69/M |
| #58 | GPT-5 Codex (high) | OpenAI | 167.4 tok/s | 167.4 tok/s | $3.44/M |
| #59 | Mistral Small 4 (Reasoning) | Mistral | 166.7 tok/s | 166.7 tok/s | $0.262/M |
| #60 | Qwen3.5 35B A3B (Non-reasoning) | Alibaba | 166.4 tok/s | 166.4 tok/s | $0.688/M |
| #61 | GPT-5.6 Luna (Non-reasoning) | OpenAI | 163.5 tok/s | 163.5 tok/s | $2.25/M |
| #62 | o4-mini (high) | OpenAI | 162.3 tok/s | 162.3 tok/s | $1.93/M |
| #63 | GPT-5.4 nano (xhigh) | OpenAI | 161.4 tok/s | 161.4 tok/s | $0.463/M |
| #64 | Grok 4.20 0309 v2 (Reasoning) | SpaceXAI | 159.2 tok/s | 159.2 tok/s | $3.00/M |
| #65 | GPT-5 (ChatGPT) | OpenAI | 158.5 tok/s | 158.5 tok/s | $3.44/M |
| #66 | Ministral 3 3B | Mistral | 158.5 tok/s | 158.5 tok/s | $0.100/M |
| #67 | GPT-5.4 nano (medium) | OpenAI | 155.9 tok/s | 155.9 tok/s | $0.463/M |
| #68 | GPT-5 nano (medium) | OpenAI | 155.7 tok/s | 155.7 tok/s | $0.138/M |
| #69 | Llama 3.1 Instruct 8B | Meta | 155.5 tok/s | 155.5 tok/s | $0.100/M |
| #70 | GPT-5.4 mini (Non-Reasoning) | OpenAI | 155.1 tok/s | 155.1 tok/s | $1.69/M |
| #71 | GPT-5 nano (high) | OpenAI | 154.5 tok/s | 154.5 tok/s | $0.138/M |
| #72 | GPT-5.4 (xhigh) | OpenAI | 154.5 tok/s | 154.5 tok/s | $5.63/M |
| #73 | Nova 2.0 Pro Preview (low) | Amazon | 149.5 tok/s | 149.5 tok/s | $3.44/M |
| #74 | GLM-5.2 (max) | Z AI | 149.2 tok/s | 149.2 tok/s | $2.15/M |
| #75 | GPT-4.1 nano | OpenAI | 148 tok/s | 148 tok/s | $0.175/M |
| #76 | Nova Lite | Amazon | 147.8 tok/s | 147.8 tok/s | $0.105/M |
| #77 | NVIDIA Nemotron 3 Super 120B A12B (Reasoning) | NVIDIA | 145.9 tok/s | 145.9 tok/s | $0.381/M |
| #78 | Qwen3.5 122B A10B (Non-reasoning) | Alibaba | 145.4 tok/s | 145.4 tok/s | $1.10/M |
| #79 | Mistral Small 3 | Mistral | 145.3 tok/s | 145.3 tok/s | $0.150/M |
| #80 | Mistral Small 3.2 | Mistral | 144.9 tok/s | 144.9 tok/s | $0.150/M |