Meilleurs modèles
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) est actuellement le modèle le mieux classé pour Humanity's Last Exam dans les données disponibles.
Utilisez le premier modèle comme point de départ, pas comme décision automatique.
Comparez les meilleurs choix selon le prix, la vitesse, la disponibilité et vos contraintes.
Ouvrez la page de résultats et la méthodologie avant de citer le classement.
Humanity's Last Exam is a broad, difficult knowledge and reasoning benchmark intended to stress advanced models.
| Rang | Modèle | Fournisseur | Valeur |
|---|---|---|---|
| #1 | Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | Anthropic | 53,3% |
| #2 | GPT-5.6 Sol (max) | OpenAI | 47,2% |
| #3 | Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | Anthropic | 45,7% |
| #4 | Muse Spark 1.1 (xhigh) | Meta | 45,1% |
| #5 | GPT-5.6 Sol (xhigh) | OpenAI |
This answer uses the exact same metric and live database ranking as the linked Easy Benchmarks leaderboard.
Source: Artificial Analysis Humanity's Last Exam. Mis à jour: 16 juil. 2026.
| 44,7% |
| #6 | Gemini 3.1 Pro Preview | 44,7% |
| #7 | GPT-5.5 (xhigh) | OpenAI | 44,3% |
| #8 | GPT-5.6 Sol (high) | OpenAI | 44,1% |
| #9 | GPT-5.5 (high) | OpenAI | 43% |
| #10 | GPT-5.6 Terra (max) | OpenAI | 41,8% |
| #11 | GPT-5.4 (xhigh) | OpenAI | 41,6% |
| #12 | Gemini 3.5 Flash (high) | 41% |
| #13 | GPT-5.5 (medium) | OpenAI | 40,6% |
| #14 | Grok 4.5 (high) | SpaceXAI | 40,3% |
| #15 | GLM-5.2 (max) | Z AI | 40,1% |
| #16 | GPT-5.6 Terra (xhigh) | OpenAI | 40% |
| #17 | GPT-5.3 Codex (xhigh) | OpenAI | 39,9% |
| #18 | Muse Spark | Meta | 39,9% |
| #19 | Gemini 3.5 Flash (medium) | 39,9% |
| #20 | GPT-5.6 Sol (medium) | OpenAI | 39,7% |