Easy Benchmarks
Workspace
Overview
Benchmarks
Benchmarks list
Compare
Overall Index
Coding
Math
MMLU-Pro
Speed
Value
LLMs
Audio
Image
Video
Log inSign up
Back

Output Speed

Median output tokens generated per second.

Output Speed is an operational performance metric, not an intelligence benchmark. Artificial Analysis defines it as the average number of output tokens received per second after the first token arrives, using OpenAI tokens as the standard unit.

Test type: Hosted endpoint performance measurement. Higher values mean faster streaming after response start.

Coverage

314 models have this metric.

880.1 tok/s

Current leader: Mercury 2

Project links

Values come from the current Artificial Analysis performance dataset, read from Supabase when configured.

Artificial Analysis model leaderboardArtificial Analysis performance methodology

Top Speed Models

Top models ranked by Speed.

Leaderboard

RankModelCreatorValueSpeedBlended Price
#1Mercury 2Inception880.1 tok/s880.1 tok/s$0.375/M
#2
Granite 4.0 H Small
IBM
439.5 tok/s
439.5 tok/s
$0.107/M
#3Granite 3.3 8B (Non-reasoning)IBM414.9 tok/s414.9 tok/s$0.085/M
#4LFM2.5-VL-1.6BLiquid AI392.7 tok/s392.7 tok/s-
#5Step 3.7 FlashStepFun385.2 tok/s385.2 tok/s$0.438/M
#6MCHyperNova 60B 2605Multiverse Computing350.9 tok/s350.9 tok/s$0.065/M
#7LFM2.5-8B-A1BLiquid AI343.4 tok/s343.4 tok/s-
#8Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA320 tok/s320 tok/s$0.131/M
#9gpt-oss-120b (low)OpenAI296.3 tok/s296.3 tok/s$0.262/M
#10Gemini 3.1 Flash-LiteGoogle291.6 tok/s291.6 tok/s$0.563/M
#11Llama 3.1 Nemotron Instruct 70BNVIDIA286.3 tok/s286.3 tok/s$1.20/M
#12NVIDIA Nemotron Nano 12B v2 VL (Reasoning)NVIDIA282.5 tok/s282.5 tok/s$0.300/M
#13gpt-oss-20b (low)OpenAI260.9 tok/s260.9 tok/s$0.095/M
#14Step 3.5 Flash 2603StepFun256.9 tok/s256.9 tok/s$0.150/M
#15Nova MicroAmazon249.8 tok/s249.8 tok/s$0.061/M
#16Step 3.5 FlashStepFun247.4 tok/s247.4 tok/s$0.150/M
#17GPT-5.6 Luna (max)OpenAI243.6 tok/s243.6 tok/s$2.25/M
#18Gemini 3.5 Flash (high)Google241.2 tok/s241.2 tok/s$3.38/M
#19Gemini 2.5 Flash-Lite (Reasoning)Google237.8 tok/s237.8 tok/s$0.175/M
#20Gemini 3.5 Flash (medium)Google234.7 tok/s234.7 tok/s$3.38/M
#21gpt-oss-120b (high)OpenAI231.3 tok/s231.3 tok/s$0.262/M
#22Qwen3.5 Omni FlashAlibaba227.8 tok/s227.8 tok/s$0.275/M
#23gpt-oss-20b (high)OpenAI224.5 tok/s224.5 tok/s$0.088/M
#24NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning)NVIDIA224.5 tok/s224.5 tok/s$0.300/M
#25o3-mini (high)OpenAI221.6 tok/s221.6 tok/s$1.93/M
#26Gemini 2.5 Flash (Reasoning)Google219.1 tok/s219.1 tok/s$0.850/M
#27o3-miniOpenAI210.5 tok/s210.5 tok/s$1.93/M
#28Nova 2.0 Lite (Non-reasoning)Amazon206.7 tok/s206.7 tok/s$0.850/M
#29GPT-5.1 Codex mini (high)OpenAI203.4 tok/s203.4 tok/s$0.688/M
#30Gemini 3.5 Flash (minimal)Google201.4 tok/s201.4 tok/s$3.38/M
#31Sarvam 30B (high)Sarvam200.7 tok/s200.7 tok/s$0.047/M
#32Qwen3.7 MaxAlibaba198.9 tok/s198.9 tok/s$3.75/M
#33Gemini 3 Flash Preview (Reasoning)Google197.7 tok/s197.7 tok/s$1.13/M
#34Gemini 3 Flash Preview (Non-reasoning)Google195.8 tok/s195.8 tok/s$1.13/M
#35GPT-5.6 Luna (high)OpenAI191.2 tok/s191.2 tok/s$2.25/M
#36Command A+Cohere191 tok/s191 tok/s-
#37Gemini 2.5 Flash (Non-reasoning)Google188.7 tok/s188.7 tok/s$0.850/M
#38GPT-5.6 Luna (medium)OpenAI185.8 tok/s185.8 tok/s$2.25/M
#39Nova 2.0 Lite (low)Amazon185.7 tok/s185.7 tok/s$0.850/M
#40GPT-5.6 Luna (xhigh)OpenAI185.7 tok/s185.7 tok/s$2.25/M
#41Nova 2.0 Lite (high)Amazon182.5 tok/s182.5 tok/s$0.850/M
#42Gemini 2.5 Flash-Lite (Non-reasoning)Google182.3 tok/s182.3 tok/s$0.175/M
#43Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA181.6 tok/s181.6 tok/s$1.18/M
#44GPT-4o (Nov '24)OpenAI181.2 tok/s181.2 tok/s$4.38/M
#45Qwen3 Next 80B A3B InstructAlibaba180.8 tok/s180.8 tok/s$0.875/M
#46Trinity Large ThinkingArcee AI179.7 tok/s179.7 tok/s$0.395/M
#47Jamba 1.6 MiniAI21 Labs179.6 tok/s179.6 tok/s$0.250/M
#48Nova 2.0 Lite (medium)Amazon176.8 tok/s176.8 tok/s$0.850/M
#49GPT-5.4 mini (medium)OpenAI175.8 tok/s175.8 tok/s$1.69/M
#50Qwen3 Next 80B A3B (Reasoning)Alibaba174.8 tok/s174.8 tok/s$1.88/M
#51GPT-5.1 Codex (high)OpenAI173.3 tok/s173.3 tok/s$3.44/M
#52Ling 2.6 FlashInclusionAI172.8 tok/s172.8 tok/s$0.150/M
#53GPT-5.6 Luna (low)OpenAI170.7 tok/s170.7 tok/s$2.25/M
#54GPT-5.4 nano (Non-Reasoning)OpenAI170.4 tok/s170.4 tok/s$0.463/M
#55GPT-5.6 Terra (max)OpenAI170.1 tok/s170.1 tok/s$5.63/M
#56GPT-5 nano (minimal)OpenAI168.7 tok/s168.7 tok/s$0.138/M
#57GPT-5.4 mini (xhigh)OpenAI167.5 tok/s167.5 tok/s$1.69/M
#58GPT-5 Codex (high)OpenAI167.4 tok/s167.4 tok/s$3.44/M
#59Mistral Small 4 (Reasoning)Mistral166.7 tok/s166.7 tok/s$0.262/M
#60Qwen3.5 35B A3B (Non-reasoning)Alibaba166.4 tok/s166.4 tok/s$0.688/M
#61GPT-5.6 Luna (Non-reasoning)OpenAI163.5 tok/s163.5 tok/s$2.25/M
#62o4-mini (high)OpenAI162.3 tok/s162.3 tok/s$1.93/M
#63GPT-5.4 nano (xhigh)OpenAI161.4 tok/s161.4 tok/s$0.463/M
#64Grok 4.20 0309 v2 (Reasoning)SpaceXAI159.2 tok/s159.2 tok/s$3.00/M
#65GPT-5 (ChatGPT)OpenAI158.5 tok/s158.5 tok/s$3.44/M
#66Ministral 3 3BMistral158.5 tok/s158.5 tok/s$0.100/M
#67GPT-5.4 nano (medium)OpenAI155.9 tok/s155.9 tok/s$0.463/M
#68GPT-5 nano (medium)OpenAI155.7 tok/s155.7 tok/s$0.138/M
#69Llama 3.1 Instruct 8BMeta155.5 tok/s155.5 tok/s$0.100/M
#70GPT-5.4 mini (Non-Reasoning)OpenAI155.1 tok/s155.1 tok/s$1.69/M
#71GPT-5 nano (high)OpenAI154.5 tok/s154.5 tok/s$0.138/M
#72GPT-5.4 (xhigh)OpenAI154.5 tok/s154.5 tok/s$5.63/M
#73Nova 2.0 Pro Preview (low)Amazon149.5 tok/s149.5 tok/s$3.44/M
#74GLM-5.2 (max)Z AI149.2 tok/s149.2 tok/s$2.15/M
#75GPT-4.1 nanoOpenAI148 tok/s148 tok/s$0.175/M
#76Nova LiteAmazon147.8 tok/s147.8 tok/s$0.105/M
#77NVIDIA Nemotron 3 Super 120B A12B (Reasoning)NVIDIA145.9 tok/s145.9 tok/s$0.381/M
#78Qwen3.5 122B A10B (Non-reasoning)Alibaba145.4 tok/s145.4 tok/s$1.10/M
#79Mistral Small 3Mistral145.3 tok/s145.3 tok/s$0.150/M
#80Mistral Small 3.2Mistral144.9 tok/s144.9 tok/s$0.150/M