Easy Benchmarks
Workspace
Overview
Benchmarks
Benchmarks list
Compare
Overall Index
Coding
Math
MMLU-Pro
Speed
Value
LLMs
Audio
Image
Video
Log inSign up
Back

Time to First Token

Median seconds until the first output token.

Time to First Token measures perceived responsiveness for streamed responses. Artificial Analysis defines it as the time from request submission to the first received token, with lower values ranking better in this app.

Test type: Hosted endpoint latency measurement. Lower values mean the response starts sooner.

Coverage

167 models have this metric.

0.16s

Current leader: Command A+

Project links

Values come from the current Artificial Analysis performance dataset, read from Supabase when configured.

Artificial Analysis model leaderboardArtificial Analysis performance methodology

Top TTFT Models

Top models ranked by TTFT.

Leaderboard

RankModelCreatorValueSpeedBlended Price
#1Command A+Cohere0.16s195.8 tok/s-
#2
Tiny Aya Global
Cohere
0.24s
128.8 tok/s
-
#3Gemma 4 E4B (Reasoning)Google0.32s103.3 tok/s$0.040/M
#4Gemma 4 E4B (Non-reasoning)Google0.33s102.1 tok/s$0.040/M
#5Command ACohere0.33s54.6 tok/s$4.38/M
#6Phi-4 Mini InstructMicrosoft0.34s45.1 tok/s-
#7Phi-4 Multimodal InstructMicrosoft0.37s21.9 tok/s-
#8North Mini CodeCohere0.43s21.6 tok/s-
#9Ministral 3 3BMistral0.43s290.8 tok/s$0.100/M
#10Ministral 3 8BMistral0.44s105.6 tok/s$0.150/M
#11Granite 4.1 8BIBM0.44s114.9 tok/s$0.063/M
#12Qwen3.5 4B (Reasoning)Alibaba0.44s23.8 tok/s$0.060/M
#13CECeleris-1Celeris0.46s2,116.3 tok/s$3.00/M
#14MCHyperNova 60B 2605Multiverse Computing0.47s418.1 tok/s$0.065/M
#15Phi-4Microsoft0.47s41.9 tok/s$0.219/M
#16Ministral 3 14BMistral0.53s88.5 tok/s$0.200/M
#17Qwen3.5 4B (Non-reasoning)Alibaba0.53s19.3 tok/s$0.060/M
#18gpt-oss-120b (high)OpenAI0.54s193.7 tok/s$0.262/M
#19Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA0.54s319.3 tok/s$0.131/M
#20Magistral Small 1.2Mistral0.56s95 tok/s$0.750/M
#21NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning)NVIDIA0.56s218 tok/s$0.088/M
#22gpt-oss-120b (low)OpenAI0.57s229.2 tok/s$0.261/M
#23Hermes 4 - Llama-3.1 70B (Reasoning)Nous Research0.59s89 tok/s$0.198/M
#24gpt-oss-20b (low)OpenAI0.60s195.1 tok/s$0.109/M
#25Hermes 4 - Llama-3.1 70B (Non-reasoning)Nous Research0.60s77.4 tok/s$0.198/M
#26Nova MicroAmazon0.61s264 tok/s$0.061/M
#27Llama 4 ScoutMeta0.61s83.5 tok/s$0.300/M
#28gpt-oss-20b (high)OpenAI0.61s185.1 tok/s$0.103/M
#29Magistral Medium 1.2Mistral0.62s46.2 tok/s$2.75/M
#30Llama 4 MaverickMeta0.63s103.9 tok/s$0.415/M
#31Llama 3.3 Instruct 70BMeta0.64s75.1 tok/s$0.630/M
#32Trinity Large ThinkingArcee AI0.66s206 tok/s$0.395/M
#33Mistral Small 4 (Reasoning)Mistral0.69s149.9 tok/s$0.262/M
#34Mistral Small 4 (Non-reasoning)Mistral0.69s151.7 tok/s$0.262/M
#35Llama 3.1 Nemotron Ultra 253B v1 (Reasoning)NVIDIA0.69s51.7 tok/s$0.900/M
#36Grok 4.3 (Non-reasoning)SpaceXAI0.70s130.4 tok/s$1.56/M
#37GPT-5.6 Terra (Non-reasoning)OpenAI0.70s107.1 tok/s$4.50/M
#38Mistral Large 3Mistral0.70s63.4 tok/s$0.750/M
#39GPT-5.6 Luna (Non-reasoning)OpenAI0.71s165.6 tok/s$0.450/M
#40Devstral Small 2Mistral0.71s55.4 tok/s-
#41Gemma 4 26B A4B (Non-reasoning)Google0.72s60.5 tok/s$0.198/M
#42Ling 2.6 FlashInclusionAI0.73s83.2 tok/s$0.150/M
#43NVIDIA Nemotron 3 Nano 30B A3B (Reasoning)NVIDIA0.73s259.4 tok/s$0.088/M
#44Hermes 4 - Llama-3.1 405B (Non-reasoning)Nous Research0.74s38.6 tok/s$1.50/M
#45Nova 2.0 Lite (Non-reasoning)Amazon0.78s217.7 tok/s$0.850/M
#46Nova 2.0 Pro Preview (Non-reasoning)Amazon0.78s124.2 tok/s$3.44/M
#47Hermes 4 - Llama-3.1 405B (Reasoning)Nous Research0.78s37 tok/s$1.50/M
#48Mistral Medium 3.5Mistral0.79s100.2 tok/s$3.00/M
#49Gemini 3.5 Flash (minimal)Google0.81s223.3 tok/s$3.38/M
#50LFM2.5-VL-1.6BLiquid AI0.81s379.7 tok/s-
#51Claude 4.5 Haiku (Non-reasoning)Anthropic0.82s105.3 tok/s$2.00/M
#52Devstral 2Mistral0.84s56 tok/s-
#53NANex-N2-ProNex AGI0.88s132 tok/s$1.00/M
#54DeepSeek V4 Flash (Reasoning, Max Effort)DeepSeek0.89s106.7 tok/s$0.175/M
#55DeepSeek V4 Flash (Non-reasoning)DeepSeek0.92s108.7 tok/s$0.175/M
#56Qwen3 Omni 30B A3B InstructAlibaba0.92s107.9 tok/s$0.430/M
#57Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA0.95s199.6 tok/s$1.18/M
#58Qwen3.5 Omni FlashAlibaba0.95s246.6 tok/s$0.275/M
#59Qwen3 Omni 30B A3B (Reasoning)Alibaba0.96s108.3 tok/s$0.430/M
#60Jamba 1.7 LargeAI21 Labs0.97s56.4 tok/s$3.50/M
#61Gemma 4 31B (Reasoning)Google0.97s35.3 tok/s-
#62DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek0.98s55.3 tok/s$0.544/M
#63GLM-5.2 (max)Z AI0.99s99.9 tok/s$2.15/M
#64Qwen3 Next 80B A3B InstructAlibaba0.99s194.4 tok/s$0.875/M
#65Qwen3.5 122B A10B (Reasoning)Alibaba1.00s138.3 tok/s$1.10/M
#66Qwen3.5 122B A10B (Non-reasoning)Alibaba1.00s154.5 tok/s$1.10/M
#67Qwen3.5 35B A3B (Non-reasoning)Alibaba1.02s175.9 tok/s$0.688/M
#68NVIDIA Nemotron 3 Super 120B A12B (Reasoning)NVIDIA1.04s146.6 tok/s$0.350/M
#69DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek1.04s59.6 tok/s$0.544/M
#70Step 3.7 FlashStepFun1.05s394.3 tok/s$0.438/M
#71Qwen3 Coder NextAlibaba1.07s126.8 tok/s$0.563/M
#72GPT-5.6 Sol (Non-reasoning)OpenAI1.07s62.3 tok/s$11.25/M
#73Qwen3.5 9B (Reasoning)Alibaba1.09s70.5 tok/s$0.151/M
#74Nova PremierAmazon1.11s65.3 tok/s$5.00/M
#75Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic1.12s52.8 tok/s$6.00/M
#76KAT Coder Pro V2KwaiKAT1.13s105 tok/s$0.525/M
#77DeepSeek V4 Pro (Non-reasoning)DeepSeek1.15s63.8 tok/s$0.544/M
#78Claude Sonnet 5 (Adaptive Reasoning, Low Effort)Anthropic1.17s62.4 tok/s$4.00/M
#79Kimi K2.7 CodeKimi1.18s39.1 tok/s$1.71/M
#80Qwen3 Next 80B A3B (Reasoning)Alibaba1.18s201.9 tok/s$1.88/M