Median seconds until the first output token.
Time to First Token measures perceived responsiveness for streamed responses. Artificial Analysis defines it as the time from request submission to the first received token, with lower values ranking better in this app.
Test type: Hosted endpoint latency measurement. Lower values mean the response starts sooner.
167 models have this metric.
Current leader: Command A+
Project links
Values come from the current Artificial Analysis performance dataset, read from Supabase when configured.
Top models ranked by TTFT.
| Rank | Model | Creator | Value | Speed | Blended Price |
|---|---|---|---|---|---|
| #1 | Command A+ | Cohere | 0.16s | 195.8 tok/s | - |
| #2 |
| Cohere |
| 0.24s |
| 128.8 tok/s |
| - |
| #3 | Gemma 4 E4B (Reasoning) | 0.32s | 103.3 tok/s | $0.040/M |
| #4 | Gemma 4 E4B (Non-reasoning) | 0.33s | 102.1 tok/s | $0.040/M |
| #5 | Command A | Cohere | 0.33s | 54.6 tok/s | $4.38/M |
| #6 | Phi-4 Mini Instruct | Microsoft | 0.34s | 45.1 tok/s | - |
| #7 | Phi-4 Multimodal Instruct | Microsoft | 0.37s | 21.9 tok/s | - |
| #8 | North Mini Code | Cohere | 0.43s | 21.6 tok/s | - |
| #9 | Ministral 3 3B | Mistral | 0.43s | 290.8 tok/s | $0.100/M |
| #10 | Ministral 3 8B | Mistral | 0.44s | 105.6 tok/s | $0.150/M |
| #11 | Granite 4.1 8B | IBM | 0.44s | 114.9 tok/s | $0.063/M |
| #12 | Qwen3.5 4B (Reasoning) | Alibaba | 0.44s | 23.8 tok/s | $0.060/M |
| #13 | Celeris-1 | Celeris | 0.46s | 2,116.3 tok/s | $3.00/M |
| #14 | HyperNova 60B 2605 | Multiverse Computing | 0.47s | 418.1 tok/s | $0.065/M |
| #15 | Phi-4 | Microsoft | 0.47s | 41.9 tok/s | $0.219/M |
| #16 | Ministral 3 14B | Mistral | 0.53s | 88.5 tok/s | $0.200/M |
| #17 | Qwen3.5 4B (Non-reasoning) | Alibaba | 0.53s | 19.3 tok/s | $0.060/M |
| #18 | gpt-oss-120b (high) | OpenAI | 0.54s | 193.7 tok/s | $0.262/M |
| #19 | Nemotron 3 Nano Omni 30B A3B Reasoning | NVIDIA | 0.54s | 319.3 tok/s | $0.131/M |
| #20 | Magistral Small 1.2 | Mistral | 0.56s | 95 tok/s | $0.750/M |
| #21 | NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning) | NVIDIA | 0.56s | 218 tok/s | $0.088/M |
| #22 | gpt-oss-120b (low) | OpenAI | 0.57s | 229.2 tok/s | $0.261/M |
| #23 | Hermes 4 - Llama-3.1 70B (Reasoning) | Nous Research | 0.59s | 89 tok/s | $0.198/M |
| #24 | gpt-oss-20b (low) | OpenAI | 0.60s | 195.1 tok/s | $0.109/M |
| #25 | Hermes 4 - Llama-3.1 70B (Non-reasoning) | Nous Research | 0.60s | 77.4 tok/s | $0.198/M |
| #26 | Nova Micro | Amazon | 0.61s | 264 tok/s | $0.061/M |
| #27 | Llama 4 Scout | Meta | 0.61s | 83.5 tok/s | $0.300/M |
| #28 | gpt-oss-20b (high) | OpenAI | 0.61s | 185.1 tok/s | $0.103/M |
| #29 | Magistral Medium 1.2 | Mistral | 0.62s | 46.2 tok/s | $2.75/M |
| #30 | Llama 4 Maverick | Meta | 0.63s | 103.9 tok/s | $0.415/M |
| #31 | Llama 3.3 Instruct 70B | Meta | 0.64s | 75.1 tok/s | $0.630/M |
| #32 | Trinity Large Thinking | Arcee AI | 0.66s | 206 tok/s | $0.395/M |
| #33 | Mistral Small 4 (Reasoning) | Mistral | 0.69s | 149.9 tok/s | $0.262/M |
| #34 | Mistral Small 4 (Non-reasoning) | Mistral | 0.69s | 151.7 tok/s | $0.262/M |
| #35 | Llama 3.1 Nemotron Ultra 253B v1 (Reasoning) | NVIDIA | 0.69s | 51.7 tok/s | $0.900/M |
| #36 | Grok 4.3 (Non-reasoning) | SpaceXAI | 0.70s | 130.4 tok/s | $1.56/M |
| #37 | GPT-5.6 Terra (Non-reasoning) | OpenAI | 0.70s | 107.1 tok/s | $4.50/M |
| #38 | Mistral Large 3 | Mistral | 0.70s | 63.4 tok/s | $0.750/M |
| #39 | GPT-5.6 Luna (Non-reasoning) | OpenAI | 0.71s | 165.6 tok/s | $0.450/M |
| #40 | Devstral Small 2 | Mistral | 0.71s | 55.4 tok/s | - |
| #41 | Gemma 4 26B A4B (Non-reasoning) | 0.72s | 60.5 tok/s | $0.198/M |
| #42 | Ling 2.6 Flash | InclusionAI | 0.73s | 83.2 tok/s | $0.150/M |
| #43 | NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) | NVIDIA | 0.73s | 259.4 tok/s | $0.088/M |
| #44 | Hermes 4 - Llama-3.1 405B (Non-reasoning) | Nous Research | 0.74s | 38.6 tok/s | $1.50/M |
| #45 | Nova 2.0 Lite (Non-reasoning) | Amazon | 0.78s | 217.7 tok/s | $0.850/M |
| #46 | Nova 2.0 Pro Preview (Non-reasoning) | Amazon | 0.78s | 124.2 tok/s | $3.44/M |
| #47 | Hermes 4 - Llama-3.1 405B (Reasoning) | Nous Research | 0.78s | 37 tok/s | $1.50/M |
| #48 | Mistral Medium 3.5 | Mistral | 0.79s | 100.2 tok/s | $3.00/M |
| #49 | Gemini 3.5 Flash (minimal) | 0.81s | 223.3 tok/s | $3.38/M |
| #50 | LFM2.5-VL-1.6B | Liquid AI | 0.81s | 379.7 tok/s | - |
| #51 | Claude 4.5 Haiku (Non-reasoning) | Anthropic | 0.82s | 105.3 tok/s | $2.00/M |
| #52 | Devstral 2 | Mistral | 0.84s | 56 tok/s | - |
| #53 | Nex-N2-Pro | Nex AGI | 0.88s | 132 tok/s | $1.00/M |
| #54 | DeepSeek V4 Flash (Reasoning, Max Effort) | DeepSeek | 0.89s | 106.7 tok/s | $0.175/M |
| #55 | DeepSeek V4 Flash (Non-reasoning) | DeepSeek | 0.92s | 108.7 tok/s | $0.175/M |
| #56 | Qwen3 Omni 30B A3B Instruct | Alibaba | 0.92s | 107.9 tok/s | $0.430/M |
| #57 | Nemotron 3 Ultra 550B A55B (Reasoning) | NVIDIA | 0.95s | 199.6 tok/s | $1.18/M |
| #58 | Qwen3.5 Omni Flash | Alibaba | 0.95s | 246.6 tok/s | $0.275/M |
| #59 | Qwen3 Omni 30B A3B (Reasoning) | Alibaba | 0.96s | 108.3 tok/s | $0.430/M |
| #60 | Jamba 1.7 Large | AI21 Labs | 0.97s | 56.4 tok/s | $3.50/M |
| #61 | Gemma 4 31B (Reasoning) | 0.97s | 35.3 tok/s | - |
| #62 | DeepSeek V4 Pro (Reasoning, High Effort) | DeepSeek | 0.98s | 55.3 tok/s | $0.544/M |
| #63 | GLM-5.2 (max) | Z AI | 0.99s | 99.9 tok/s | $2.15/M |
| #64 | Qwen3 Next 80B A3B Instruct | Alibaba | 0.99s | 194.4 tok/s | $0.875/M |
| #65 | Qwen3.5 122B A10B (Reasoning) | Alibaba | 1.00s | 138.3 tok/s | $1.10/M |
| #66 | Qwen3.5 122B A10B (Non-reasoning) | Alibaba | 1.00s | 154.5 tok/s | $1.10/M |
| #67 | Qwen3.5 35B A3B (Non-reasoning) | Alibaba | 1.02s | 175.9 tok/s | $0.688/M |
| #68 | NVIDIA Nemotron 3 Super 120B A12B (Reasoning) | NVIDIA | 1.04s | 146.6 tok/s | $0.350/M |
| #69 | DeepSeek V4 Pro (Reasoning, Max Effort) | DeepSeek | 1.04s | 59.6 tok/s | $0.544/M |
| #70 | Step 3.7 Flash | StepFun | 1.05s | 394.3 tok/s | $0.438/M |
| #71 | Qwen3 Coder Next | Alibaba | 1.07s | 126.8 tok/s | $0.563/M |
| #72 | GPT-5.6 Sol (Non-reasoning) | OpenAI | 1.07s | 62.3 tok/s | $11.25/M |
| #73 | Qwen3.5 9B (Reasoning) | Alibaba | 1.09s | 70.5 tok/s | $0.151/M |
| #74 | Nova Premier | Amazon | 1.11s | 65.3 tok/s | $5.00/M |
| #75 | Claude Sonnet 4.6 (Non-reasoning, Low Effort) | Anthropic | 1.12s | 52.8 tok/s | $6.00/M |
| #76 | KAT Coder Pro V2 | KwaiKAT | 1.13s | 105 tok/s | $0.525/M |
| #77 | DeepSeek V4 Pro (Non-reasoning) | DeepSeek | 1.15s | 63.8 tok/s | $0.544/M |
| #78 | Claude Sonnet 5 (Adaptive Reasoning, Low Effort) | Anthropic | 1.17s | 62.4 tok/s | $4.00/M |
| #79 | Kimi K2.7 Code | Kimi | 1.18s | 39.1 tok/s | $1.71/M |
| #80 | Qwen3 Next 80B A3B (Reasoning) | Alibaba | 1.18s | 201.9 tok/s | $1.88/M |