Easy Benchmarks
Workspace
Overview
Benchmarks
Benchmarks list
Compare
Overall Index
Coding
Math
MMLU-Pro
Speed
Value
LLMs
Audio
Image
Video
Log inSign up
Back

GPQA

Graduate-level science and reasoning benchmark score.

GPQA, often reported as GPQA Diamond in model leaderboards, is a graduate-level Google-proof Q&A benchmark. It focuses on expert science reasoning where strong retrieval alone is not enough.

Test type: Expert multiple-choice science Q&A, usually evaluated with exact option extraction.

Coverage

540 models have this metric.

94.1%

Current leader: GPT-5.6 Sol (max)

Project links

This app ranks the GPQA score exposed by the Artificial Analysis snapshot.

Artificial Analysis resultsGitHubPaper

Top GPQA Models

Top models ranked by GPQA.

Leaderboard

RankModelCreatorValueSpeedBlended Price
#1GPT-5.6 Sol (max)OpenAI94.1%67.4 tok/s$11.25/M
#2
Gemini 3.1 Pro Preview
Google
94.1%
123.1 tok/s
$4.50/M
#3GPT-5.5 (xhigh)OpenAI93.5%73.9 tok/s$11.25/M
#4GPT-5.5 (high)OpenAI93.2%58.4 tok/s$11.25/M
#5GPT-5.6 Sol (xhigh)OpenAI93.1%57 tok/s$11.25/M
#6Grok 4.5 (high)SpaceXAI93.1%122.8 tok/s$3.00/M
#7MiniMax-M3MiniMax92.9%94.8 tok/s$0.525/M
#8GPT-5.6 Sol (high)OpenAI92.8%56.2 tok/s$11.25/M
#9GPT-5.5 (medium)OpenAI92.6%58.3 tok/s$11.25/M
#10GPT-5.6 Sol (medium)OpenAI92.6%55.6 tok/s$11.25/M
#11Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic92.6%69.4 tok/s$20.00/M
#12GPT-5.6 Terra (max)OpenAI92.5%170.1 tok/s$5.63/M
#13Qwen3.7 MaxAlibaba92.3%198.9 tok/s$3.75/M
#14Gemini 3.5 Flash (high)Google92.2%241.2 tok/s$3.38/M
#15Gemini 3.5 Flash (medium)Google92.1%234.7 tok/s$3.38/M
#16Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropic92.0%54.3 tok/s$10.00/M
#17GPT-5.4 (xhigh)OpenAI92.0%154.5 tok/s$5.63/M
#18GPT-5.3 Codex (xhigh)OpenAI91.5%95.4 tok/s$4.81/M
#19Claude Opus 4.7 (Adaptive Reasoning, Max Effort)Anthropic91.4%49.5 tok/s$10.00/M
#20GPT-5.6 Luna (max)OpenAI91.1%243.6 tok/s$2.25/M
#21Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic91.1%89.2 tok/s$4.00/M
#22Kimi K2.6Kimi91.1%39.2 tok/s$1.71/M
#23Grok 4.20 0309 v2 (Reasoning)SpaceXAI91.1%159.2 tok/s$3.00/M
#24GPT-5.5 (low)OpenAI91.0%56.8 tok/s$11.25/M
#25GPT-5.6 Terra (xhigh)OpenAI90.8%117.6 tok/s$5.63/M
#26Gemini 3 Pro Preview (high)Google90.8%n/a$4.50/M
#27DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek90.5%57.6 tok/s$0.544/M
#28GPT-5.2 (xhigh)OpenAI90.3%80.5 tok/s$4.81/M
#29Grok 4.3 (high)SpaceXAI90.1%112.5 tok/s$1.56/M
#30Qwen3.7 PlusAlibaba90.0%52.4 tok/s$0.700/M
#31GPT-5.2 Codex (xhigh)OpenAI89.9%125.5 tok/s$4.81/M
#32GPT-5.6 Sol (low)OpenAI89.8%57.1 tok/s$11.25/M
#33Muse Spark 1.1 (xhigh)Meta89.8%124.3 tok/s$2.00/M
#34Gemini 3 Flash Preview (Reasoning)Google89.8%197.7 tok/s$1.13/M
#35TEHy3Tencent89.7%48 tok/s-
#36GPT-5.6 Terra (high)OpenAI89.6%109.5 tok/s$5.63/M
#37Kimi K2.7 CodeKimi89.6%43 tok/s$1.71/M
#38Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic89.6%49.5 tok/s$10.00/M
#39GPT-5.6 Luna (xhigh)OpenAI89.5%185.7 tok/s$2.25/M
#40Grok Build 0.1 0616SpaceXAI89.5%46.3 tok/s$1.25/M
#41GLM-5.2 (max)Z AI89.5%149.2 tok/s$2.15/M
#42DeepSeek V4 Flash (Reasoning, Max Effort)DeepSeek89.4%101.1 tok/s$0.175/M
#43Qwen3.5 397B A17B (Reasoning)Alibaba89.3%58.2 tok/s$1.35/M
#44GPT-5.6 Luna (high)OpenAI89.2%191.2 tok/s$2.25/M
#45NANex-N2-ProNex AGI89.2%138.6 tok/s$1.00/M
#46Grok 4.3 (medium)SpaceXAI89.0%107.9 tok/s$1.56/M
#47DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek88.8%63.7 tok/s$0.544/M
#48Qwen3.6 Max PreviewAlibaba88.8%37 tok/s$2.93/M
#49Gemini 3 Pro Preview (low)Google88.7%n/a$4.50/M
#50Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic88.5%43 tok/s$10.00/M
#51Grok 4.20 0309 (Reasoning)SpaceXAI88.5%n/a$3.00/M
#52Muse SparkMeta88.4%n/a-
#53Qwen3.6 PlusAlibaba88.2%53.3 tok/s$1.13/M
#54Kimi K2.5 (Reasoning)Kimi87.9%46.8 tok/s$1.20/M
#55Grok 4SpaceXAI87.7%n/a$11.00/M
#56GPT-5.4 mini (xhigh)OpenAI87.5%167.5 tok/s$1.69/M
#57Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic87.5%72 tok/s$6.00/M
#58MiniMax-M2.7MiniMax87.4%48.6 tok/s$0.525/M
#59GPT-5.1 (high)OpenAI87.3%89.9 tok/s$3.44/M
#60GPT-5.6 Terra (medium)OpenAI87.2%103.3 tok/s$5.63/M
#61TMInkling (xhigh)Thinking Machines87.2%82.9 tok/s$2.57/M
#62GPT-5.4 (low)OpenAI87.1%98.2 tok/s$5.63/M
#63DeepSeek V3.2 SpecialeDeepSeek87.1%n/a-
#64MiMo-V2-ProXiaomi87.0%n/a-
#65GLM-5.1 (Reasoning)Z AI86.8%67.9 tok/s$2.15/M
#66DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek86.7%n/a$0.175/M
#67Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA86.7%181.6 tok/s$1.18/M
#68TEHy3-preview (Reasoning)Tencent86.7%124.1 tok/s$0.200/M
#69MiMo-V2.5-ProXiaomi86.6%57.1 tok/s$0.544/M
#70Claude Opus 4.5 (Reasoning)Anthropic86.6%58.5 tok/s$10.00/M
#71GPT-5.2 (medium)OpenAI86.4%n/a$4.81/M
#72Qwen3.5 397B A17B (Non-reasoning)Alibaba86.1%57.1 tok/s$1.35/M
#73Qwen3 Max ThinkingAlibaba86.1%n/a-
#74GPT-5.1 Codex (high)OpenAI86.0%173.3 tok/s$3.44/M
#75GPT-5.6 Luna (medium)OpenAI85.9%185.8 tok/s$2.25/M
#76GLM-4.7 (Reasoning)Z AI85.9%101.5 tok/s$1.00/M
#77Qwen3.5 27B (Reasoning)Alibaba85.8%78.7 tok/s$0.825/M
#78Gemma 4 31B (Reasoning)Google85.7%35.4 tok/s-
#79Qwen3.5 122B A10B (Reasoning)Alibaba85.7%127.8 tok/s$1.10/M
#80Ring-2.6-1TInclusionAI85.7%122.7 tok/s$0.850/M