Difficult broad knowledge and reasoning benchmark score.
Humanity's Last Exam is a broad expert benchmark from CAIS and Scale AI. The public project describes 2,500 difficult questions across many subjects, with closed-ended answers for automatic grading and held-out questions to monitor overfitting.
Test type: Closed-ended expert reasoning and knowledge benchmark with automatic grading.
551 models have this metric.
Current leader: Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)
Project links
This app ranks the HLE score exposed by the Artificial Analysis snapshot.
Top models ranked by HLE.
| Rank | Model | Creator | Value | Speed | Blended Price |
|---|---|---|---|---|---|
| #1 | Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | Anthropic | 53.3% | 59.9 tok/s | $20.00/M |
| #2 |
| Anthropic |
| 52.6% |
| 56.2 tok/s |
| $10.00/M |
| #3 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | Anthropic | 52.5% | 53.5 tok/s | $10.00/M |
| #4 | Claude Opus 5 (Adaptive Reasoning, High Effort) | Anthropic | 50.7% | 53.6 tok/s | $10.00/M |
| #5 | Claude Opus 5 (Adaptive Reasoning, Medium Effort) | Anthropic | 49.2% | 54.1 tok/s | $10.00/M |
| #6 | GPT-5.6 Sol (max) | OpenAI | 47.2% | 68.1 tok/s | $11.25/M |
| #7 | Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | Anthropic | 45.7% | n/a | $10.00/M |
| #8 | Muse Spark 1.1 (xhigh) | Meta | 45.1% | 139.7 tok/s | $2.00/M |
| #9 | Gemini 3.1 Pro Preview | 44.7% | 134.1 tok/s | $4.50/M |
| #10 | GPT-5.6 Sol (xhigh) | OpenAI | 44.7% | 62.8 tok/s | $11.25/M |
| #11 | GPT-5.5 (xhigh) | OpenAI | 44.3% | n/a | $11.25/M |
| #12 | Kimi K3 (max) | Kimi | 44.3% | 33.5 tok/s | $6.00/M |
| #13 | GPT-5.6 Sol (high) | OpenAI | 44.1% | 65.8 tok/s | $11.25/M |
| #14 | GPT-5.5 (high) | OpenAI | 43.0% | n/a | $11.25/M |
| #15 | GPT-5.6 Terra (max) | OpenAI | 41.8% | 132 tok/s | $4.50/M |
| #16 | GPT-5.4 (xhigh) | OpenAI | 41.6% | n/a | $5.63/M |
| #17 | Claude Opus 5 (Adaptive Reasoning, Low Effort) | Anthropic | 41.3% | 53.9 tok/s | $10.00/M |
| #18 | Gemini 3.5 Flash (high) | 41.0% | 220.6 tok/s | $3.38/M |
| #19 | GPT-5.5 (medium) | OpenAI | 40.6% | n/a | $11.25/M |
| #20 | Grok 4.5 (high) | SpaceXAI | 40.3% | 53.3 tok/s | $3.00/M |
| #21 | GLM-5.2 (max) | Z AI | 40.1% | 99.9 tok/s | $2.15/M |
| #22 | GPT-5.6 Terra (xhigh) | OpenAI | 40.0% | 109.7 tok/s | $4.50/M |
| #23 | Gemini 3.5 Flash (medium) | 39.9% | 240.9 tok/s | $3.38/M |
| #24 | GPT-5.3 Codex (xhigh) | OpenAI | 39.9% | 109.1 tok/s | $4.81/M |
| #25 | Muse Spark | Meta | 39.9% | n/a | - |
| #26 | GPT-5.6 Sol (medium) | OpenAI | 39.7% | 57.6 tok/s | $11.25/M |
| #27 | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) | Anthropic | 39.6% | n/a | $10.00/M |
| #28 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | Anthropic | 39.6% | 83.6 tok/s | $4.00/M |
| #29 | Gemini 3.6 Flash (high) | 38.3% | 214.8 tok/s | $3.00/M |
| #30 | Motif 3 (Beta) | Motif Technologies | 38.2% | n/a | - |
| #31 | Qwen3.7 Max | Alibaba | 38.1% | 202 tok/s | $3.75/M |
| #32 | Gemini 3 Pro Preview (high) | 37.2% | n/a | $4.50/M |
| #33 | GPT-5.6 Luna (max) | OpenAI | 37.2% | 174.2 tok/s | $0.450/M |
| #34 | MiniMax-M3 | MiniMax | 37.1% | 78 tok/s | $0.525/M |
| #35 | DeepSeek V4 Flash 0731 (Reasoning, Max Effort) | DeepSeek | 36.8% | n/a | $0.175/M |
| #36 | Claude Opus 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 36.7% | n/a | $10.00/M |
| #37 | GPT-5.6 Terra (high) | OpenAI | 36.7% | 117.9 tok/s | $4.50/M |
| #38 | GPT-5.6 Sol (low) | OpenAI | 36.6% | 59.1 tok/s | $11.25/M |
| #39 | Grok Build 0.1 0616 | SpaceXAI | 36.0% | n/a | $1.25/M |
| #40 | DeepSeek V4 Pro (Reasoning, Max Effort) | DeepSeek | 35.9% | 59.6 tok/s | $0.544/M |
| #41 | Kimi K2.6 | Kimi | 35.9% | n/a | $1.71/M |
| #42 | GPT-5.6 Luna (xhigh) | OpenAI | 35.6% | 174 tok/s | $0.450/M |
| #43 | GPT-5.2 (xhigh) | OpenAI | 35.4% | n/a | $4.81/M |
| #44 | Grok 4.3 (high) | SpaceXAI | 35.0% | n/a | $1.56/M |
| #45 | Gemini 3 Flash Preview (Reasoning) | 34.7% | n/a | $1.13/M |
| #46 | MiMo-V2.5-Pro | Xiaomi | 33.8% | 44.2 tok/s | $0.544/M |
| #47 | DeepSeek V4 Pro (Reasoning, High Effort) | DeepSeek | 33.5% | 55.3 tok/s | $0.544/M |
| #48 | GPT-5.2 Codex (xhigh) | OpenAI | 33.5% | n/a | $4.81/M |
| #49 | KAT-Coder-Pro V1 | KwaiKAT | 33.4% | n/a | - |
| #50 | Qwen3.7 Plus | Alibaba | 33.4% | 52 tok/s | $0.700/M |
| #51 | Kimi K2.7 Code | Kimi | 32.8% | 39.1 tok/s | $1.71/M |
| #52 | Nex-N2-Pro | Nex AGI | 32.4% | 132 tok/s | $1.00/M |
| #53 | Grok 4.20 0309 v2 (Reasoning) | SpaceXAI | 32.2% | n/a | $3.00/M |
| #54 | DeepSeek V4 Flash (Reasoning, Max Effort) | DeepSeek | 32.1% | 106.7 tok/s | $0.175/M |
| #55 | LongCat 2.0 | LongCat | 32.1% | 45.5 tok/s | $1.30/M |
| #56 | Agnes 2.5 Pro Alpha | Sapiens AI | 31.9% | 127.2 tok/s | $0.563/M |
| #57 | GPT-5.6 Luna (high) | OpenAI | 31.6% | 172.1 tok/s | $0.450/M |
| #58 | GPT-5.6 Terra (medium) | OpenAI | 31.6% | 111.6 tok/s | $4.50/M |
| #59 | Hy3 | Tencent | 31.6% | 72.2 tok/s | $0.241/M |
| #60 | Inkling Small | Thinking Machines | 31.6% | 95.3 tok/s | $0.525/M |
| #61 | Claude Opus 4.7 (Non-reasoning, High Effort) | Anthropic | 31.2% | n/a | $10.00/M |
| #62 | GPT-5.5 (low) | OpenAI | 31.0% | n/a | $11.25/M |
| #63 | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 30.0% | n/a | $6.00/M |
| #64 | Grok 4.20 0309 (Reasoning) | SpaceXAI | 30.0% | n/a | $3.00/M |
| #65 | Inkling (xhigh) | Thinking Machines | 29.7% | 79.3 tok/s | $2.57/M |
| #66 | Kimi K2.5 (Reasoning) | Kimi | 29.4% | n/a | $1.20/M |
| #67 | GPT-5.4 (low) | OpenAI | 28.9% | n/a | $5.63/M |
| #68 | Qwen3.6 Max Preview | Alibaba | 28.9% | n/a | $2.93/M |
| #69 | Claude Opus 4.5 (Reasoning) | Anthropic | 28.4% | n/a | $10.00/M |
| #70 | MiMo-V2-Pro | Xiaomi | 28.3% | n/a | - |
| #71 | Grok 4.3 (medium) | SpaceXAI | 28.1% | 129.8 tok/s | $1.56/M |
| #72 | MiniMax-M2.7 | MiniMax | 28.1% | n/a | $0.525/M |
| #73 | GLM-5.1 (Reasoning) | Z AI | 28.0% | n/a | $2.14/M |
| #74 | DeepSeek V4 Flash (Reasoning, High Effort) | DeepSeek | 27.8% | n/a | $0.175/M |
| #75 | Gemini 3 Pro Preview (low) | 27.6% | n/a | $4.50/M |
| #76 | GPT-5.6 Terra (low) | OpenAI | 27.4% | 115.7 tok/s | $4.50/M |
| #77 | Qwen3.5 397B A17B (Reasoning) | Alibaba | 27.3% | 63.9 tok/s | $1.35/M |
| #78 | GLM-5 (Reasoning) | Z AI | 27.2% | n/a | $1.55/M |
| #79 | GPT-5.4 mini (xhigh) | OpenAI | 26.6% | n/a | $1.69/M |
| #80 | Nemotron 3 Ultra 550B A55B (Reasoning) | NVIDIA | 26.6% | 199.6 tok/s | $1.18/M |