Easy Benchmarks
Workspace
Overview
Benchmarks
Benchmarks list
Compare
Overall Index
Coding
Math
MMLU-Pro
Speed
Value
LLMs
Audio
Image
Video
Log inSign up
Back

Output Speed

Median output tokens generated per second.

Output Speed is an operational performance metric, not an intelligence benchmark. Artificial Analysis defines it as the average number of output tokens received per second after the first token arrives, using OpenAI tokens as the standard unit.

Test type: Hosted endpoint performance measurement. Higher values mean faster streaming after response start.

Coverage

167 models have this metric.

2,116.3 tok/s

Current leader: Celeris-1

Project links

Values come from the current Artificial Analysis performance dataset, read from Supabase when configured.

Artificial Analysis model leaderboardArtificial Analysis performance methodology

Top Speed Models

Top models ranked by Speed.

Leaderboard

RankModelCreatorValueSpeedBlended Price
#1CECeleris-1Celeris2,116.3 tok/s2,116.3 tok/s$3.00/M
#2
Mercury 2
Inception
937.1 tok/s
937.1 tok/s
$0.375/M
#3Granite 4.0 H SmallIBM426 tok/s426 tok/s$0.107/M
#4MCHyperNova 60B 2605Multiverse Computing418.1 tok/s418.1 tok/s$0.065/M
#5Step 3.7 FlashStepFun394.3 tok/s394.3 tok/s$0.438/M
#6LFM2.5-VL-1.6BLiquid AI379.7 tok/s379.7 tok/s-
#7Gemini 3.5 Flash-LiteGoogle351.2 tok/s351.2 tok/s$0.850/M
#8LFM2.5-8B-A1BLiquid AI343.4 tok/s343.4 tok/s-
#9Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA319.3 tok/s319.3 tok/s$0.131/M
#10Gemini 3.1 Flash-LiteGoogle302.4 tok/s302.4 tok/s$0.563/M
#11Ministral 3 3BMistral290.8 tok/s290.8 tok/s$0.100/M
#12Nova MicroAmazon264 tok/s264 tok/s$0.061/M
#13NVIDIA Nemotron 3 Nano 30B A3B (Reasoning)NVIDIA259.4 tok/s259.4 tok/s$0.088/M
#14Qwen3.5 Omni FlashAlibaba246.6 tok/s246.6 tok/s$0.275/M
#15Gemini 3.5 Flash (medium)Google240.9 tok/s240.9 tok/s$3.38/M
#16NVIDIA Nemotron Nano 9B V2 (Reasoning)NVIDIA234 tok/s234 tok/s$0.070/M
#17gpt-oss-120b (low)OpenAI229.2 tok/s229.2 tok/s$0.261/M
#18Gemini 3.5 Flash (minimal)Google223.3 tok/s223.3 tok/s$3.38/M
#19Gemini 3.5 Flash (high)Google220.6 tok/s220.6 tok/s$3.38/M
#20NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning)NVIDIA218 tok/s218 tok/s$0.088/M
#21Nova 2.0 Lite (Non-reasoning)Amazon217.7 tok/s217.7 tok/s$0.850/M
#22Gemini 3.6 Flash (high)Google214.8 tok/s214.8 tok/s$3.00/M
#23Trinity Large ThinkingArcee AI206 tok/s206 tok/s$0.395/M
#24Qwen3.7 MaxAlibaba202 tok/s202 tok/s$3.75/M
#25Qwen3 Next 80B A3B (Reasoning)Alibaba201.9 tok/s201.9 tok/s$1.88/M
#26Nova 2.0 Lite (medium)Amazon199.6 tok/s199.6 tok/s$0.850/M
#27Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA199.6 tok/s199.6 tok/s$1.18/M
#28Command A+Cohere195.8 tok/s195.8 tok/s-
#29gpt-oss-20b (low)OpenAI195.1 tok/s195.1 tok/s$0.109/M
#30Qwen3 Next 80B A3B InstructAlibaba194.4 tok/s194.4 tok/s$0.875/M
#31gpt-oss-120b (high)OpenAI193.7 tok/s193.7 tok/s$0.262/M
#32Nova 2.0 Lite (high)Amazon190.3 tok/s190.3 tok/s$0.850/M
#33gpt-oss-20b (high)OpenAI185.1 tok/s185.1 tok/s$0.103/M
#34Nova 2.0 Lite (low)Amazon184.1 tok/s184.1 tok/s$0.850/M
#35NVIDIA Nemotron Nano 9B V2 (Non-reasoning)NVIDIA176.5 tok/s176.5 tok/s$0.086/M
#36Qwen3.5 35B A3B (Non-reasoning)Alibaba175.9 tok/s175.9 tok/s$0.688/M
#37GPT-5.6 Luna (max)OpenAI174.2 tok/s174.2 tok/s$0.450/M
#38GPT-5.6 Luna (xhigh)OpenAI174 tok/s174 tok/s$0.450/M
#39GPT-5.6 Luna (high)OpenAI172.1 tok/s172.1 tok/s$0.450/M
#40GPT-5.6 Luna (Non-reasoning)OpenAI165.6 tok/s165.6 tok/s$0.450/M
#41GPT-5.6 Luna (low)OpenAI161.6 tok/s161.6 tok/s$0.450/M
#42NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning)NVIDIA159.7 tok/s159.7 tok/s$0.300/M
#43GPT-5.6 Luna (medium)OpenAI158.4 tok/s158.4 tok/s$0.450/M
#44Qwen3.5 122B A10B (Non-reasoning)Alibaba154.5 tok/s154.5 tok/s$1.10/M
#45Mistral Small 4 (Non-reasoning)Mistral151.7 tok/s151.7 tok/s$0.262/M
#46Nova 2.0 Pro Preview (low)Amazon151.3 tok/s151.3 tok/s$3.44/M
#47Mistral Small 4 (Reasoning)Mistral149.9 tok/s149.9 tok/s$0.262/M
#48NVIDIA Nemotron 3 Super 120B A12B (Reasoning)NVIDIA146.6 tok/s146.6 tok/s$0.350/M
#49TEHy3-preview (Reasoning)Tencent145 tok/s145 tok/s$0.107/M
#50Claude 4.5 Haiku (Reasoning)Anthropic142.4 tok/s142.4 tok/s$2.00/M
#51o3OpenAI140.1 tok/s140.1 tok/s$3.50/M
#52Muse Spark 1.1 (xhigh)Meta139.7 tok/s139.7 tok/s$2.00/M
#53Qwen3.5 122B A10B (Reasoning)Alibaba138.3 tok/s138.3 tok/s$1.10/M
#54Grok 4.3 (low)SpaceXAI137.5 tok/s137.5 tok/s$1.56/M
#55Nova 2.0 Pro Preview (medium)Amazon136.2 tok/s136.2 tok/s$3.44/M
#56Qwen3.6 35B A3B (Reasoning)Alibaba134.4 tok/s134.4 tok/s$0.557/M
#57Gemini 3.1 Pro PreviewGoogle134.1 tok/s134.1 tok/s$4.50/M
#58GPT-5.6 Terra (max)OpenAI132 tok/s132 tok/s$4.50/M
#59NANex-N2-ProNex AGI132 tok/s132 tok/s$1.00/M
#60Gemini 2.5 ProGoogle130.8 tok/s130.8 tok/s$3.44/M
#61Grok 4.3 (Non-reasoning)SpaceXAI130.4 tok/s130.4 tok/s$1.56/M
#62Grok 4.3 (medium)SpaceXAI129.8 tok/s129.8 tok/s$1.56/M
#63Tiny Aya GlobalCohere128.8 tok/s128.8 tok/s-
#64SAAgnes 2.5 Pro AlphaSapiens AI127.2 tok/s127.2 tok/s$0.563/M
#65Qwen3 Coder NextAlibaba126.8 tok/s126.8 tok/s$0.563/M
#66Ring-2.6-1TInclusionAI125.7 tok/s125.7 tok/s$0.850/M
#67Nova 2.0 Pro Preview (Non-reasoning)Amazon124.2 tok/s124.2 tok/s$3.44/M
#68GPT-5.6 Terra (high)OpenAI117.9 tok/s117.9 tok/s$4.50/M
#69GPT-5.6 Terra (low)OpenAI115.7 tok/s115.7 tok/s$4.50/M
#70Granite 4.1 8BIBM114.9 tok/s114.9 tok/s$0.063/M
#71GPT-5.6 Terra (medium)OpenAI111.6 tok/s111.6 tok/s$4.50/M
#72GPT-5.6 Terra (xhigh)OpenAI109.7 tok/s109.7 tok/s$4.50/M
#73GPT-5.3 Codex (xhigh)OpenAI109.1 tok/s109.1 tok/s$4.81/M
#74TEHy3-preview (Non-reasoning)Tencent108.8 tok/s108.8 tok/s$0.107/M
#75DeepSeek V4 Flash (Non-reasoning)DeepSeek108.7 tok/s108.7 tok/s$0.175/M
#76Qwen3 Omni 30B A3B (Reasoning)Alibaba108.3 tok/s108.3 tok/s$0.430/M
#77Qwen3 Omni 30B A3B InstructAlibaba107.9 tok/s107.9 tok/s$0.430/M
#78GPT-5.6 Terra (Non-reasoning)OpenAI107.1 tok/s107.1 tok/s$4.50/M
#79DeepSeek V4 Flash (Reasoning, Max Effort)DeepSeek106.7 tok/s106.7 tok/s$0.175/M
#80Ministral 3 8BMistral105.6 tok/s105.6 tok/s$0.150/M