Easy Benchmarks
Workspace
Overview
Benchmarks
Benchmarks list
Compare
Overall Index
Coding
Math
MMLU-Pro
Speed
Value
LLMs
Audio
Image
Video
Log inSign up
Back

Time to First Token

Median seconds until the first output token.

Time to First Token measures perceived responsiveness for streamed responses. Artificial Analysis defines it as the time from request submission to the first received token, with lower values ranking better in this app.

Test type: Hosted endpoint latency measurement. Lower values mean the response starts sooner.

Coverage

314 models have this metric.

0.16s

Current leader: Command A+

Project links

Values come from the current Artificial Analysis performance dataset, read from Supabase when configured.

Artificial Analysis model leaderboardArtificial Analysis performance methodology

Top TTFT Models

Top models ranked by TTFT.

Leaderboard

RankModelCreatorValueSpeedBlended Price
#1Command A+Cohere0.16s191 tok/s-
#2
North Mini Code
Cohere
0.18s
81.4 tok/s
-
#3NVIDIA Nemotron Nano 12B v2 VL (Reasoning)NVIDIA0.22s282.5 tok/s$0.300/M
#4Tiny Aya GlobalCohere0.22s133.5 tok/s-
#5Llama Nemotron Super 49B v1.5 (Reasoning)NVIDIA0.26s51.8 tok/s$0.400/M
#6Llama Nemotron Super 49B v1.5 (Non-reasoning)NVIDIA0.26s52.2 tok/s$0.400/M
#7Gemini 2.5 Flash-Lite (Non-reasoning)Google0.32s182.3 tok/s$0.175/M
#8Phi-4 Mini InstructMicrosoft0.32s45.7 tok/s-
#9Hermes 3 - Llama-3.1 70BNous Research0.34s37.3 tok/s$0.700/M
#10Command ACohere0.34s55.1 tok/s$4.38/M
#11Cogito v2.1 (Reasoning)Deep Cogito0.35s96.6 tok/s$1.25/M
#12Phi-4 Multimodal InstructMicrosoft0.37s16.4 tok/s-
#13Ministral 3 3BMistral0.37s158.5 tok/s$0.100/M
#14Gemma 3n E4B InstructGoogle0.38s49.7 tok/s$0.025/M
#15Grok Build 0.1 0616SpaceXAI0.40s46.3 tok/s$1.25/M
#16Qwen3.5 4B (Reasoning)Alibaba0.40s22.8 tok/s$0.060/M
#17Mistral Small 3.2Mistral0.40s144.9 tok/s$0.150/M
#18NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning)NVIDIA0.41s99.8 tok/s$0.088/M
#19gpt-oss-20b (high)OpenAI0.41s224.5 tok/s$0.088/M
#20Qwen3.5 4B (Non-reasoning)Alibaba0.43s23 tok/s$0.060/M
#21Granite 4.1 8BIBM0.43s117.8 tok/s$0.063/M
#22GPT-4.1 nanoOpenAI0.44s148 tok/s$0.175/M
#23Gemini 2.5 Flash (Non-reasoning)Google0.44s188.7 tok/s$0.850/M
#24Ministral 3 8BMistral0.44s89 tok/s$0.150/M
#25Magistral Small 1.2Mistral0.45s83.2 tok/s$0.750/M
#26Grok 4.20 0309 v2 (Non-reasoning)SpaceXAI0.47s140.6 tok/s$3.00/M
#27gpt-oss-20b (low)OpenAI0.48s260.9 tok/s$0.095/M
#28Ministral 3 14BMistral0.48s75.5 tok/s$0.200/M
#29Llama 3.1 Instruct 8BMeta0.49s155.5 tok/s$0.100/M
#30GPT-5.4 nano (Non-Reasoning)OpenAI0.49s170.4 tok/s$0.463/M
#31Llama 3 Instruct 8BMeta0.49s79.8 tok/s$0.070/M
#32GPT-4o (Nov '24)OpenAI0.49s181.2 tok/s$4.38/M
#33Mistral Small 3.1Mistral0.49s144.9 tok/s$0.150/M
#34Mistral 7B InstructMistral0.50s91.5 tok/s$0.250/M
#35Mistral Small (Feb '24)Mistral0.50s142.2 tok/s$1.50/M
#36Llama 3.2 Instruct 11B (Vision)Meta0.51s72.8 tok/s$0.345/M
#37Mistral Small 4 (Non-reasoning)Mistral0.51s142.1 tok/s$0.262/M
#38gpt-oss-120b (low)OpenAI0.51s296.3 tok/s$0.262/M
#39Mistral Medium 3.1Mistral0.52s83.6 tok/s$0.800/M
#40Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA0.53s320 tok/s$0.131/M
#41Llama 3.2 Instruct 1BMeta0.54s86.4 tok/s$0.100/M
#42QwQ 32BAlibaba0.54s32 tok/s$0.745/M
#43GPT-4o (Aug '24)OpenAI0.55s99.6 tok/s$4.38/M
#44GPT-5 (ChatGPT)OpenAI0.55s158.5 tok/s$3.44/M
#45Mistral Medium 3Mistral0.55s41.8 tok/s$0.800/M
#46gpt-oss-120b (high)OpenAI0.56s231.3 tok/s$0.262/M
#47Mistral MediumMistral0.56s63.2 tok/s$4.09/M
#48Magistral Medium 1.2Mistral0.57s41.6 tok/s$2.75/M
#49Llama 3.2 Instruct 3BMeta0.57s51.7 tok/s$0.150/M
#50GPT-5.4 mini (Non-Reasoning)OpenAI0.57s155.1 tok/s$1.69/M
#51GPT-5.6 Luna (Non-reasoning)OpenAI0.57s163.5 tok/s$2.25/M
#52Llama 3.2 Instruct 90B (Vision)Meta0.58s60.1 tok/s$1.38/M
#53Mistral Small 4 (Reasoning)Mistral0.58s166.7 tok/s$0.262/M
#54Nova LiteAmazon0.58s147.8 tok/s$0.105/M
#55Nova MicroAmazon0.58s249.8 tok/s$0.061/M
#56GPT-4.1 miniOpenAI0.59s72.5 tok/s$0.700/M
#57Llama 4 ScoutMeta0.59s89.6 tok/s$0.287/M
#58Hermes 4 - Llama-3.1 70B (Reasoning)Nous Research0.60s92.1 tok/s$0.198/M
#59Hermes 4 - Llama-3.1 70B (Non-reasoning)Nous Research0.60s96.2 tok/s$0.198/M
#60Llama 3.3 Instruct 70BMeta0.61s87.6 tok/s$0.612/M
#61Llama 3 Instruct 70BMeta0.61s46 tok/s$1.18/M
#62GPT-4o (May '24)OpenAI0.61s94.7 tok/s$7.50/M
#63GPT-4.1OpenAI0.61s90 tok/s$3.50/M
#64GPT-4o miniOpenAI0.62s73.5 tok/s$0.262/M
#65DeepSeek R1 Distill Llama 70BDeepSeek0.62s22.6 tok/s$0.787/M
#66Mistral Small (Sep '24)Mistral0.62s144.6 tok/s$0.300/M
#67Mistral Large 3Mistral0.62s59.6 tok/s$0.750/M
#68Llama 4 MaverickMeta0.62s98.3 tok/s$0.475/M
#69GLM-4.7 (Non-reasoning)Z AI0.63s87.8 tok/s$1.00/M
#70GPT-5.6 Terra (Non-reasoning)OpenAI0.63s101.7 tok/s$5.63/M
#71GPT-5.2 (Non-reasoning)OpenAI0.64s62 tok/s$4.81/M
#72MCHyperNova 60B 2605Multiverse Computing0.64s350.9 tok/s$0.065/M
#73Ling 2.6 FlashInclusionAI0.64s172.8 tok/s$0.150/M
#74Llama 3.1 Instruct 405BMeta0.65s76.2 tok/s$3.69/M
#75GPT-5 nano (minimal)OpenAI0.66s168.7 tok/s$0.138/M
#76Mistral Small 3Mistral0.66s145.3 tok/s$0.150/M
#77Grok 3 mini Reasoning (high)SpaceXAI0.66s45.7 tok/s$0.350/M
#78Step 3.7 FlashStepFun0.67s385.2 tok/s$0.438/M
#79GPT-5.4 (Non-reasoning)OpenAI0.67s97.5 tok/s$5.63/M
#80Gemma 4 26B A4B (Non-reasoning)Google0.68s70.8 tok/s$0.198/M