Easy Benchmarks
Workspace
Overview
Benchmarks
Benchmarks list
Compare
Overall Index
Coding
Math
MMLU-Pro
Speed
Value
LLMs
Audio
Image
Video
Log inSign up
Back

Humanity's Last Exam

Difficult broad knowledge and reasoning benchmark score.

Humanity's Last Exam is a broad expert benchmark from CAIS and Scale AI. The public project describes 2,500 difficult questions across many subjects, with closed-ended answers for automatic grading and held-out questions to monitor overfitting.

Test type: Closed-ended expert reasoning and knowledge benchmark with automatic grading.

Coverage

536 models have this metric.

53.3%

Current leader: Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)

Project links

This app ranks the HLE score exposed by the Artificial Analysis snapshot.

Official websiteGitHub

Top HLE Models

Top models ranked by HLE.

Leaderboard

RankModelCreatorValueSpeedBlended Price
#1Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic53.3%69.4 tok/s$20.00/M
#2
GPT-5.6 Sol (max)
OpenAI
47.2%
67.4 tok/s
$11.25/M
#3Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropic45.7%54.3 tok/s$10.00/M
#4Muse Spark 1.1 (xhigh)Meta45.1%124.3 tok/s$2.00/M
#5GPT-5.6 Sol (xhigh)OpenAI44.7%57 tok/s$11.25/M
#6Gemini 3.1 Pro PreviewGoogle44.7%123.1 tok/s$4.50/M
#7GPT-5.5 (xhigh)OpenAI44.3%73.9 tok/s$11.25/M
#8GPT-5.6 Sol (high)OpenAI44.1%56.2 tok/s$11.25/M
#9GPT-5.5 (high)OpenAI43.0%58.4 tok/s$11.25/M
#10GPT-5.6 Terra (max)OpenAI41.8%170.1 tok/s$5.63/M
#11GPT-5.4 (xhigh)OpenAI41.6%154.5 tok/s$5.63/M
#12Gemini 3.5 Flash (high)Google41.0%241.2 tok/s$3.38/M
#13GPT-5.5 (medium)OpenAI40.6%58.3 tok/s$11.25/M
#14Grok 4.5 (high)SpaceXAI40.3%122.8 tok/s$3.00/M
#15GLM-5.2 (max)Z AI40.1%149.2 tok/s$2.15/M
#16GPT-5.6 Terra (xhigh)OpenAI40.0%117.6 tok/s$5.63/M
#17GPT-5.3 Codex (xhigh)OpenAI39.9%95.4 tok/s$4.81/M
#18Muse SparkMeta39.9%n/a-
#19Gemini 3.5 Flash (medium)Google39.9%234.7 tok/s$3.38/M
#20GPT-5.6 Sol (medium)OpenAI39.7%55.6 tok/s$11.25/M
#21Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic39.6%89.2 tok/s$4.00/M
#22Claude Opus 4.7 (Adaptive Reasoning, Max Effort)Anthropic39.6%49.5 tok/s$10.00/M
#23Qwen3.7 MaxAlibaba38.1%198.9 tok/s$3.75/M
#24GPT-5.6 Luna (max)OpenAI37.2%243.6 tok/s$2.25/M
#25Gemini 3 Pro Preview (high)Google37.2%n/a$4.50/M
#26MiniMax-M3MiniMax37.1%94.8 tok/s$0.525/M
#27GPT-5.6 Terra (high)OpenAI36.7%109.5 tok/s$5.63/M
#28Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic36.7%49.5 tok/s$10.00/M
#29GPT-5.6 Sol (low)OpenAI36.6%57.1 tok/s$11.25/M
#30Grok Build 0.1 0616SpaceXAI36.0%46.3 tok/s$1.25/M
#31DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek35.9%63.7 tok/s$0.544/M
#32Kimi K2.6Kimi35.9%39.2 tok/s$1.71/M
#33GPT-5.6 Luna (xhigh)OpenAI35.6%185.7 tok/s$2.25/M
#34GPT-5.2 (xhigh)OpenAI35.4%80.5 tok/s$4.81/M
#35Grok 4.3 (high)SpaceXAI35.0%112.5 tok/s$1.56/M
#36Gemini 3 Flash Preview (Reasoning)Google34.7%197.7 tok/s$1.13/M
#37MiMo-V2.5-ProXiaomi33.8%57.1 tok/s$0.544/M
#38DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek33.5%57.6 tok/s$0.544/M
#39GPT-5.2 Codex (xhigh)OpenAI33.5%125.5 tok/s$4.81/M
#40KAT-Coder-Pro V1KwaiKAT33.4%n/a-
#41Qwen3.7 PlusAlibaba33.4%52.4 tok/s$0.700/M
#42Kimi K2.7 CodeKimi32.8%43 tok/s$1.71/M
#43NANex-N2-ProNex AGI32.4%138.6 tok/s$1.00/M
#44Grok 4.20 0309 v2 (Reasoning)SpaceXAI32.2%159.2 tok/s$3.00/M
#45DeepSeek V4 Flash (Reasoning, Max Effort)DeepSeek32.1%101.1 tok/s$0.175/M
#46LongCat 2.0LongCat32.1%n/a-
#47GPT-5.6 Terra (medium)OpenAI31.6%103.3 tok/s$5.63/M
#48GPT-5.6 Luna (high)OpenAI31.6%191.2 tok/s$2.25/M
#49TEHy3Tencent31.6%48 tok/s-
#50Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic31.2%43 tok/s$10.00/M
#51GPT-5.5 (low)OpenAI31.0%56.8 tok/s$11.25/M
#52Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic30.0%72 tok/s$6.00/M
#53Grok 4.20 0309 (Reasoning)SpaceXAI30.0%n/a$3.00/M
#54TMInkling (xhigh)Thinking Machines29.7%82.9 tok/s$2.57/M
#55Kimi K2.5 (Reasoning)Kimi29.4%46.8 tok/s$1.20/M
#56GPT-5.4 (low)OpenAI28.9%98.2 tok/s$5.63/M
#57Qwen3.6 Max PreviewAlibaba28.9%37 tok/s$2.93/M
#58Claude Opus 4.5 (Reasoning)Anthropic28.4%58.5 tok/s$10.00/M
#59MiMo-V2-ProXiaomi28.3%n/a-
#60Grok 4.3 (medium)SpaceXAI28.1%107.9 tok/s$1.56/M
#61MiniMax-M2.7MiniMax28.1%48.6 tok/s$0.525/M
#62GLM-5.1 (Reasoning)Z AI28.0%67.9 tok/s$2.15/M
#63DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek27.8%n/a$0.175/M
#64Gemini 3 Pro Preview (low)Google27.6%n/a$4.50/M
#65GPT-5.6 Terra (low)OpenAI27.4%102.3 tok/s$5.63/M
#66Qwen3.5 397B A17B (Reasoning)Alibaba27.3%58.2 tok/s$1.35/M
#67GLM-5 (Reasoning)Z AI27.2%46.2 tok/s$1.55/M
#68GPT-5.4 mini (xhigh)OpenAI26.6%167.5 tok/s$1.69/M
#69Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA26.6%181.6 tok/s$1.18/M
#70GPT-5.4 nano (xhigh)OpenAI26.5%161.4 tok/s$0.463/M
#71GPT-5 (high)OpenAI26.5%102.7 tok/s$3.44/M
#72GPT-5.1 (high)OpenAI26.5%89.9 tok/s$3.44/M
#73Qwen3 Max ThinkingAlibaba26.2%n/a-
#74DeepSeek V3.2 SpecialeDeepSeek26.1%n/a-
#75Qwen3.6 PlusAlibaba25.7%53.3 tok/s$1.13/M
#76GLM-5.1 (Non-reasoning)Z AI25.6%52.4 tok/s$2.15/M
#77GPT-5 Codex (high)OpenAI25.6%167.4 tok/s$3.44/M
#78TEHy3-preview (Reasoning)Tencent25.5%124.1 tok/s$0.200/M
#79GLM-5-TurboZ AI25.4%n/a-
#80MiMo-V2.5Xiaomi25.2%75.5 tok/s$0.175/M