Easy Benchmarks
Workspace
Overview
Benchmarks
Benchmarks list
Compare
Overall Index
Coding
Math
MMLU-Pro
Speed
Value
LLMs
Audio
Image
Video
Log inSign up
Back

GPQA

Graduate-level science and reasoning benchmark score.

GPQA, often reported as GPQA Diamond in model leaderboards, is a graduate-level Google-proof Q&A benchmark. It focuses on expert science reasoning where strong retrieval alone is not enough.

Test type: Expert multiple-choice science Q&A, usually evaluated with exact option extraction.

Coverage

555 models have this metric.

94.1%

Current leader: Gemini 3.1 Pro Preview

Project links

This app ranks the GPQA score exposed by the Artificial Analysis snapshot.

Artificial Analysis resultsGitHubPaper

Top GPQA Models

Top models ranked by GPQA.

Leaderboard

RankModelCreatorValueSpeedBlended Price
#1Gemini 3.1 Pro PreviewGoogle94.1%134.1 tok/s$4.50/M
#2
GPT-5.6 Sol (max)
OpenAI
94.1%
68.1 tok/s
$11.25/M
#3Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic93.7%53.6 tok/s$10.00/M
#4Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic93.7%53.5 tok/s$10.00/M
#5GPT-5.5 (xhigh)OpenAI93.5%n/a$11.25/M
#6Kimi K3 (max)Kimi93.5%33.5 tok/s$6.00/M
#7Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic93.2%56.2 tok/s$10.00/M
#8GPT-5.5 (high)OpenAI93.2%n/a$11.25/M
#9GPT-5.6 Sol (xhigh)OpenAI93.1%62.8 tok/s$11.25/M
#10Grok 4.5 (high)SpaceXAI93.1%53.3 tok/s$3.00/M
#11MiniMax-M3MiniMax92.9%78 tok/s$0.525/M
#12Gemini 3.6 Flash (high)Google92.8%214.8 tok/s$3.00/M
#13GPT-5.6 Sol (high)OpenAI92.8%65.8 tok/s$11.25/M
#14Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic92.6%59.9 tok/s$20.00/M
#15GPT-5.5 (medium)OpenAI92.6%n/a$11.25/M
#16GPT-5.6 Sol (medium)OpenAI92.6%57.6 tok/s$11.25/M
#17GPT-5.6 Terra (max)OpenAI92.5%132 tok/s$4.50/M
#18Qwen3.7 MaxAlibaba92.3%202 tok/s$3.75/M
#19Gemini 3.5 Flash (high)Google92.2%220.6 tok/s$3.38/M
#20Gemini 3.5 Flash (medium)Google92.1%240.9 tok/s$3.38/M
#21Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropic92.0%n/a$10.00/M
#22GPT-5.4 (xhigh)OpenAI92.0%n/a$5.63/M
#23Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic91.9%54.1 tok/s$10.00/M
#24GPT-5.3 Codex (xhigh)OpenAI91.5%109.1 tok/s$4.81/M
#25Claude Opus 4.7 (Adaptive Reasoning, Max Effort)Anthropic91.4%n/a$10.00/M
#26Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic91.1%83.6 tok/s$4.00/M
#27GPT-5.6 Luna (max)OpenAI91.1%174.2 tok/s$0.450/M
#28Grok 4.20 0309 v2 (Reasoning)SpaceXAI91.1%n/a$3.00/M
#29Kimi K2.6Kimi91.1%n/a$1.71/M
#30GPT-5.5 (low)OpenAI91.0%n/a$11.25/M
#31DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek90.8%n/a$0.175/M
#32Gemini 3 Pro Preview (high)Google90.8%n/a$4.50/M
#33GPT-5.6 Terra (xhigh)OpenAI90.8%109.7 tok/s$4.50/M
#34DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek90.5%55.3 tok/s$0.544/M
#35GPT-5.2 (xhigh)OpenAI90.3%n/a$4.81/M
#36Grok 4.3 (high)SpaceXAI90.1%n/a$1.56/M
#37Qwen3.7 PlusAlibaba90.0%52 tok/s$0.700/M
#38GPT-5.2 Codex (xhigh)OpenAI89.9%n/a$4.81/M
#39Gemini 3 Flash Preview (Reasoning)Google89.8%n/a$1.13/M
#40GPT-5.6 Sol (low)OpenAI89.8%59.1 tok/s$11.25/M
#41Muse Spark 1.1 (xhigh)Meta89.8%139.7 tok/s$2.00/M
#42TEHy3Tencent89.7%72.2 tok/s$0.241/M
#43Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic89.6%n/a$10.00/M
#44GPT-5.6 Terra (high)OpenAI89.6%117.9 tok/s$4.50/M
#45Kimi K2.7 CodeKimi89.6%39.1 tok/s$1.71/M
#46GLM-5.2 (max)Z AI89.5%99.9 tok/s$2.15/M
#47GPT-5.6 Luna (xhigh)OpenAI89.5%174 tok/s$0.450/M
#48Grok Build 0.1 0616SpaceXAI89.5%n/a$1.25/M
#49TMInkling SmallThinking Machines89.5%95.3 tok/s$0.525/M
#50DeepSeek V4 Flash (Reasoning, Max Effort)DeepSeek89.4%106.7 tok/s$0.175/M
#51Qwen3.5 397B A17B (Reasoning)Alibaba89.3%63.9 tok/s$1.35/M
#52GPT-5.6 Luna (high)OpenAI89.2%172.1 tok/s$0.450/M
#53NANex-N2-ProNex AGI89.2%132 tok/s$1.00/M
#54Grok 4.3 (medium)SpaceXAI89.0%129.8 tok/s$1.56/M
#55Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic88.9%53.9 tok/s$10.00/M
#56DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek88.8%59.6 tok/s$0.544/M
#57Qwen3.6 Max PreviewAlibaba88.8%n/a$2.93/M
#58Gemini 3 Pro Preview (low)Google88.7%n/a$4.50/M
#59Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic88.5%n/a$10.00/M
#60Grok 4.20 0309 (Reasoning)SpaceXAI88.5%n/a$3.00/M
#61Muse SparkMeta88.4%n/a-
#62Qwen3.6 PlusAlibaba88.2%55 tok/s$1.13/M
#63Kimi K2.5 (Reasoning)Kimi87.9%n/a$1.20/M
#64Grok 4SpaceXAI87.7%n/a$6.00/M
#65SAAgnes 2.5 Pro AlphaSapiens AI87.6%127.2 tok/s$0.563/M
#66Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic87.5%n/a$6.00/M
#67GPT-5.4 mini (xhigh)OpenAI87.5%n/a$1.69/M
#68MiniMax-M2.7MiniMax87.4%n/a$0.525/M
#69GPT-5.1 (high)OpenAI87.3%n/a$3.44/M
#70GPT-5.6 Terra (medium)OpenAI87.2%111.6 tok/s$4.50/M
#71TMInkling (xhigh)Thinking Machines87.2%79.3 tok/s$2.57/M
#72DeepSeek V3.2 SpecialeDeepSeek87.1%n/a-
#73GPT-5.4 (low)OpenAI87.1%n/a$5.63/M
#74MiMo-V2-ProXiaomi87.0%n/a-
#75Motif 3 (Beta)Motif Technologies86.9%n/a-
#76GLM-5.1 (Reasoning)Z AI86.8%n/a$2.14/M
#77DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek86.7%n/a$0.175/M
#78TEHy3-preview (Reasoning)Tencent86.7%145 tok/s$0.107/M
#79Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA86.7%199.6 tok/s$1.18/M
#80Claude Opus 4.5 (Reasoning)Anthropic86.6%n/a$10.00/M