Easy Benchmarks
Workspace
Overview
Benchmarks
Benchmarks list
Compare
Overall Index
Coding
Math
MMLU-Pro
Speed
Value
LLMs
Audio
Image
Video
Log inSign up
Back

Humanity's Last Exam

Difficult broad knowledge and reasoning benchmark score.

Humanity's Last Exam is a broad expert benchmark from CAIS and Scale AI. The public project describes 2,500 difficult questions across many subjects, with closed-ended answers for automatic grading and held-out questions to monitor overfitting.

Test type: Closed-ended expert reasoning and knowledge benchmark with automatic grading.

Coverage

551 models have this metric.

53.3%

Current leader: Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)

Project links

This app ranks the HLE score exposed by the Artificial Analysis snapshot.

Official websiteGitHub

Top HLE Models

Top models ranked by HLE.

Leaderboard

RankModelCreatorValueSpeedBlended Price
#1Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic53.3%59.9 tok/s$20.00/M
#2
Claude Opus 5 (Adaptive Reasoning, Max Effort)
Anthropic
52.6%
56.2 tok/s
$10.00/M
#3Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic52.5%53.5 tok/s$10.00/M
#4Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic50.7%53.6 tok/s$10.00/M
#5Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic49.2%54.1 tok/s$10.00/M
#6GPT-5.6 Sol (max)OpenAI47.2%68.1 tok/s$11.25/M
#7Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropic45.7%n/a$10.00/M
#8Muse Spark 1.1 (xhigh)Meta45.1%139.7 tok/s$2.00/M
#9Gemini 3.1 Pro PreviewGoogle44.7%134.1 tok/s$4.50/M
#10GPT-5.6 Sol (xhigh)OpenAI44.7%62.8 tok/s$11.25/M
#11GPT-5.5 (xhigh)OpenAI44.3%n/a$11.25/M
#12Kimi K3 (max)Kimi44.3%33.5 tok/s$6.00/M
#13GPT-5.6 Sol (high)OpenAI44.1%65.8 tok/s$11.25/M
#14GPT-5.5 (high)OpenAI43.0%n/a$11.25/M
#15GPT-5.6 Terra (max)OpenAI41.8%132 tok/s$4.50/M
#16GPT-5.4 (xhigh)OpenAI41.6%n/a$5.63/M
#17Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic41.3%53.9 tok/s$10.00/M
#18Gemini 3.5 Flash (high)Google41.0%220.6 tok/s$3.38/M
#19GPT-5.5 (medium)OpenAI40.6%n/a$11.25/M
#20Grok 4.5 (high)SpaceXAI40.3%53.3 tok/s$3.00/M
#21GLM-5.2 (max)Z AI40.1%99.9 tok/s$2.15/M
#22GPT-5.6 Terra (xhigh)OpenAI40.0%109.7 tok/s$4.50/M
#23Gemini 3.5 Flash (medium)Google39.9%240.9 tok/s$3.38/M
#24GPT-5.3 Codex (xhigh)OpenAI39.9%109.1 tok/s$4.81/M
#25Muse SparkMeta39.9%n/a-
#26GPT-5.6 Sol (medium)OpenAI39.7%57.6 tok/s$11.25/M
#27Claude Opus 4.7 (Adaptive Reasoning, Max Effort)Anthropic39.6%n/a$10.00/M
#28Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic39.6%83.6 tok/s$4.00/M
#29Gemini 3.6 Flash (high)Google38.3%214.8 tok/s$3.00/M
#30Motif 3 (Beta)Motif Technologies38.2%n/a-
#31Qwen3.7 MaxAlibaba38.1%202 tok/s$3.75/M
#32Gemini 3 Pro Preview (high)Google37.2%n/a$4.50/M
#33GPT-5.6 Luna (max)OpenAI37.2%174.2 tok/s$0.450/M
#34MiniMax-M3MiniMax37.1%78 tok/s$0.525/M
#35DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek36.8%n/a$0.175/M
#36Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic36.7%n/a$10.00/M
#37GPT-5.6 Terra (high)OpenAI36.7%117.9 tok/s$4.50/M
#38GPT-5.6 Sol (low)OpenAI36.6%59.1 tok/s$11.25/M
#39Grok Build 0.1 0616SpaceXAI36.0%n/a$1.25/M
#40DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek35.9%59.6 tok/s$0.544/M
#41Kimi K2.6Kimi35.9%n/a$1.71/M
#42GPT-5.6 Luna (xhigh)OpenAI35.6%174 tok/s$0.450/M
#43GPT-5.2 (xhigh)OpenAI35.4%n/a$4.81/M
#44Grok 4.3 (high)SpaceXAI35.0%n/a$1.56/M
#45Gemini 3 Flash Preview (Reasoning)Google34.7%n/a$1.13/M
#46MiMo-V2.5-ProXiaomi33.8%44.2 tok/s$0.544/M
#47DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek33.5%55.3 tok/s$0.544/M
#48GPT-5.2 Codex (xhigh)OpenAI33.5%n/a$4.81/M
#49KAT-Coder-Pro V1KwaiKAT33.4%n/a-
#50Qwen3.7 PlusAlibaba33.4%52 tok/s$0.700/M
#51Kimi K2.7 CodeKimi32.8%39.1 tok/s$1.71/M
#52NANex-N2-ProNex AGI32.4%132 tok/s$1.00/M
#53Grok 4.20 0309 v2 (Reasoning)SpaceXAI32.2%n/a$3.00/M
#54DeepSeek V4 Flash (Reasoning, Max Effort)DeepSeek32.1%106.7 tok/s$0.175/M
#55LongCat 2.0LongCat32.1%45.5 tok/s$1.30/M
#56SAAgnes 2.5 Pro AlphaSapiens AI31.9%127.2 tok/s$0.563/M
#57GPT-5.6 Luna (high)OpenAI31.6%172.1 tok/s$0.450/M
#58GPT-5.6 Terra (medium)OpenAI31.6%111.6 tok/s$4.50/M
#59TEHy3Tencent31.6%72.2 tok/s$0.241/M
#60TMInkling SmallThinking Machines31.6%95.3 tok/s$0.525/M
#61Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic31.2%n/a$10.00/M
#62GPT-5.5 (low)OpenAI31.0%n/a$11.25/M
#63Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic30.0%n/a$6.00/M
#64Grok 4.20 0309 (Reasoning)SpaceXAI30.0%n/a$3.00/M
#65TMInkling (xhigh)Thinking Machines29.7%79.3 tok/s$2.57/M
#66Kimi K2.5 (Reasoning)Kimi29.4%n/a$1.20/M
#67GPT-5.4 (low)OpenAI28.9%n/a$5.63/M
#68Qwen3.6 Max PreviewAlibaba28.9%n/a$2.93/M
#69Claude Opus 4.5 (Reasoning)Anthropic28.4%n/a$10.00/M
#70MiMo-V2-ProXiaomi28.3%n/a-
#71Grok 4.3 (medium)SpaceXAI28.1%129.8 tok/s$1.56/M
#72MiniMax-M2.7MiniMax28.1%n/a$0.525/M
#73GLM-5.1 (Reasoning)Z AI28.0%n/a$2.14/M
#74DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek27.8%n/a$0.175/M
#75Gemini 3 Pro Preview (low)Google27.6%n/a$4.50/M
#76GPT-5.6 Terra (low)OpenAI27.4%115.7 tok/s$4.50/M
#77Qwen3.5 397B A17B (Reasoning)Alibaba27.3%63.9 tok/s$1.35/M
#78GLM-5 (Reasoning)Z AI27.2%n/a$1.55/M
#79GPT-5.4 mini (xhigh)OpenAI26.6%n/a$1.69/M
#80Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA26.6%199.6 tok/s$1.18/M