Median seconds until the first output token.
Time to First Token measures perceived responsiveness for streamed responses. Artificial Analysis defines it as the time from request submission to the first received token, with lower values ranking better in this app.
Test type: Hosted endpoint latency measurement. Lower values mean the response starts sooner.
314 models have this metric.
Current leader: Command A+
Project links
Values come from the current Artificial Analysis performance dataset, read from Supabase when configured.
Top models ranked by TTFT.
| Rank | Model | Creator | Value | Speed | Blended Price |
|---|---|---|---|---|---|
| #1 | Command A+ | Cohere | 0.16s | 191 tok/s | - |
| #2 |
| Cohere |
| 0.18s |
| 81.4 tok/s |
| - |
| #3 | NVIDIA Nemotron Nano 12B v2 VL (Reasoning) | NVIDIA | 0.22s | 282.5 tok/s | $0.300/M |
| #4 | Tiny Aya Global | Cohere | 0.22s | 133.5 tok/s | - |
| #5 | Llama Nemotron Super 49B v1.5 (Reasoning) | NVIDIA | 0.26s | 51.8 tok/s | $0.400/M |
| #6 | Llama Nemotron Super 49B v1.5 (Non-reasoning) | NVIDIA | 0.26s | 52.2 tok/s | $0.400/M |
| #7 | Gemini 2.5 Flash-Lite (Non-reasoning) | 0.32s | 182.3 tok/s | $0.175/M |
| #8 | Phi-4 Mini Instruct | Microsoft | 0.32s | 45.7 tok/s | - |
| #9 | Hermes 3 - Llama-3.1 70B | Nous Research | 0.34s | 37.3 tok/s | $0.700/M |
| #10 | Command A | Cohere | 0.34s | 55.1 tok/s | $4.38/M |
| #11 | Cogito v2.1 (Reasoning) | Deep Cogito | 0.35s | 96.6 tok/s | $1.25/M |
| #12 | Phi-4 Multimodal Instruct | Microsoft | 0.37s | 16.4 tok/s | - |
| #13 | Ministral 3 3B | Mistral | 0.37s | 158.5 tok/s | $0.100/M |
| #14 | Gemma 3n E4B Instruct | 0.38s | 49.7 tok/s | $0.025/M |
| #15 | Grok Build 0.1 0616 | SpaceXAI | 0.40s | 46.3 tok/s | $1.25/M |
| #16 | Qwen3.5 4B (Reasoning) | Alibaba | 0.40s | 22.8 tok/s | $0.060/M |
| #17 | Mistral Small 3.2 | Mistral | 0.40s | 144.9 tok/s | $0.150/M |
| #18 | NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning) | NVIDIA | 0.41s | 99.8 tok/s | $0.088/M |
| #19 | gpt-oss-20b (high) | OpenAI | 0.41s | 224.5 tok/s | $0.088/M |
| #20 | Qwen3.5 4B (Non-reasoning) | Alibaba | 0.43s | 23 tok/s | $0.060/M |
| #21 | Granite 4.1 8B | IBM | 0.43s | 117.8 tok/s | $0.063/M |
| #22 | GPT-4.1 nano | OpenAI | 0.44s | 148 tok/s | $0.175/M |
| #23 | Gemini 2.5 Flash (Non-reasoning) | 0.44s | 188.7 tok/s | $0.850/M |
| #24 | Ministral 3 8B | Mistral | 0.44s | 89 tok/s | $0.150/M |
| #25 | Magistral Small 1.2 | Mistral | 0.45s | 83.2 tok/s | $0.750/M |
| #26 | Grok 4.20 0309 v2 (Non-reasoning) | SpaceXAI | 0.47s | 140.6 tok/s | $3.00/M |
| #27 | gpt-oss-20b (low) | OpenAI | 0.48s | 260.9 tok/s | $0.095/M |
| #28 | Ministral 3 14B | Mistral | 0.48s | 75.5 tok/s | $0.200/M |
| #29 | Llama 3.1 Instruct 8B | Meta | 0.49s | 155.5 tok/s | $0.100/M |
| #30 | GPT-5.4 nano (Non-Reasoning) | OpenAI | 0.49s | 170.4 tok/s | $0.463/M |
| #31 | Llama 3 Instruct 8B | Meta | 0.49s | 79.8 tok/s | $0.070/M |
| #32 | GPT-4o (Nov '24) | OpenAI | 0.49s | 181.2 tok/s | $4.38/M |
| #33 | Mistral Small 3.1 | Mistral | 0.49s | 144.9 tok/s | $0.150/M |
| #34 | Mistral 7B Instruct | Mistral | 0.50s | 91.5 tok/s | $0.250/M |
| #35 | Mistral Small (Feb '24) | Mistral | 0.50s | 142.2 tok/s | $1.50/M |
| #36 | Llama 3.2 Instruct 11B (Vision) | Meta | 0.51s | 72.8 tok/s | $0.345/M |
| #37 | Mistral Small 4 (Non-reasoning) | Mistral | 0.51s | 142.1 tok/s | $0.262/M |
| #38 | gpt-oss-120b (low) | OpenAI | 0.51s | 296.3 tok/s | $0.262/M |
| #39 | Mistral Medium 3.1 | Mistral | 0.52s | 83.6 tok/s | $0.800/M |
| #40 | Nemotron 3 Nano Omni 30B A3B Reasoning | NVIDIA | 0.53s | 320 tok/s | $0.131/M |
| #41 | Llama 3.2 Instruct 1B | Meta | 0.54s | 86.4 tok/s | $0.100/M |
| #42 | QwQ 32B | Alibaba | 0.54s | 32 tok/s | $0.745/M |
| #43 | GPT-4o (Aug '24) | OpenAI | 0.55s | 99.6 tok/s | $4.38/M |
| #44 | GPT-5 (ChatGPT) | OpenAI | 0.55s | 158.5 tok/s | $3.44/M |
| #45 | Mistral Medium 3 | Mistral | 0.55s | 41.8 tok/s | $0.800/M |
| #46 | gpt-oss-120b (high) | OpenAI | 0.56s | 231.3 tok/s | $0.262/M |
| #47 | Mistral Medium | Mistral | 0.56s | 63.2 tok/s | $4.09/M |
| #48 | Magistral Medium 1.2 | Mistral | 0.57s | 41.6 tok/s | $2.75/M |
| #49 | Llama 3.2 Instruct 3B | Meta | 0.57s | 51.7 tok/s | $0.150/M |
| #50 | GPT-5.4 mini (Non-Reasoning) | OpenAI | 0.57s | 155.1 tok/s | $1.69/M |
| #51 | GPT-5.6 Luna (Non-reasoning) | OpenAI | 0.57s | 163.5 tok/s | $2.25/M |
| #52 | Llama 3.2 Instruct 90B (Vision) | Meta | 0.58s | 60.1 tok/s | $1.38/M |
| #53 | Mistral Small 4 (Reasoning) | Mistral | 0.58s | 166.7 tok/s | $0.262/M |
| #54 | Nova Lite | Amazon | 0.58s | 147.8 tok/s | $0.105/M |
| #55 | Nova Micro | Amazon | 0.58s | 249.8 tok/s | $0.061/M |
| #56 | GPT-4.1 mini | OpenAI | 0.59s | 72.5 tok/s | $0.700/M |
| #57 | Llama 4 Scout | Meta | 0.59s | 89.6 tok/s | $0.287/M |
| #58 | Hermes 4 - Llama-3.1 70B (Reasoning) | Nous Research | 0.60s | 92.1 tok/s | $0.198/M |
| #59 | Hermes 4 - Llama-3.1 70B (Non-reasoning) | Nous Research | 0.60s | 96.2 tok/s | $0.198/M |
| #60 | Llama 3.3 Instruct 70B | Meta | 0.61s | 87.6 tok/s | $0.612/M |
| #61 | Llama 3 Instruct 70B | Meta | 0.61s | 46 tok/s | $1.18/M |
| #62 | GPT-4o (May '24) | OpenAI | 0.61s | 94.7 tok/s | $7.50/M |
| #63 | GPT-4.1 | OpenAI | 0.61s | 90 tok/s | $3.50/M |
| #64 | GPT-4o mini | OpenAI | 0.62s | 73.5 tok/s | $0.262/M |
| #65 | DeepSeek R1 Distill Llama 70B | DeepSeek | 0.62s | 22.6 tok/s | $0.787/M |
| #66 | Mistral Small (Sep '24) | Mistral | 0.62s | 144.6 tok/s | $0.300/M |
| #67 | Mistral Large 3 | Mistral | 0.62s | 59.6 tok/s | $0.750/M |
| #68 | Llama 4 Maverick | Meta | 0.62s | 98.3 tok/s | $0.475/M |
| #69 | GLM-4.7 (Non-reasoning) | Z AI | 0.63s | 87.8 tok/s | $1.00/M |
| #70 | GPT-5.6 Terra (Non-reasoning) | OpenAI | 0.63s | 101.7 tok/s | $5.63/M |
| #71 | GPT-5.2 (Non-reasoning) | OpenAI | 0.64s | 62 tok/s | $4.81/M |
| #72 | HyperNova 60B 2605 | Multiverse Computing | 0.64s | 350.9 tok/s | $0.065/M |
| #73 | Ling 2.6 Flash | InclusionAI | 0.64s | 172.8 tok/s | $0.150/M |
| #74 | Llama 3.1 Instruct 405B | Meta | 0.65s | 76.2 tok/s | $3.69/M |
| #75 | GPT-5 nano (minimal) | OpenAI | 0.66s | 168.7 tok/s | $0.138/M |
| #76 | Mistral Small 3 | Mistral | 0.66s | 145.3 tok/s | $0.150/M |
| #77 | Grok 3 mini Reasoning (high) | SpaceXAI | 0.66s | 45.7 tok/s | $0.350/M |
| #78 | Step 3.7 Flash | StepFun | 0.67s | 385.2 tok/s | $0.438/M |
| #79 | GPT-5.4 (Non-reasoning) | OpenAI | 0.67s | 97.5 tok/s | $5.63/M |
| #80 | Gemma 4 26B A4B (Non-reasoning) | 0.68s | 70.8 tok/s | $0.198/M |