Beste Modelle
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) ist derzeit das bestplatzierte Modell für Humanity's Last Exam in den verfügbaren Daten.
Nutze den Erstplatzierten als Ausgangspunkt, nicht als automatische Entscheidung.
Vergleiche die ersten Modelle bei Preis, Geschwindigkeit und Verfügbarkeit.
Öffne die verlinkte Ergebnisseite und Methodik, bevor du das Ergebnis zitierst.
Humanity's Last Exam is a broad, difficult knowledge and reasoning benchmark intended to stress advanced models.
| Rang | Modell | Anbieter | Wert |
|---|---|---|---|
| #1 | Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | Anthropic | 53,3% |
| #2 | GPT-5.6 Sol (max) | OpenAI | 47,2% |
| #3 | Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | Anthropic | 45,7% |
| #4 | Muse Spark 1.1 (xhigh) | Meta | 45,1% |
| #5 | GPT-5.6 Sol (xhigh) | OpenAI |
This answer uses the exact same metric and live database ranking as the linked Easy Benchmarks leaderboard.
Quelle: Artificial Analysis Humanity's Last Exam. Aktualisiert: 16.07.2026.
| 44,7% |
| #6 | Gemini 3.1 Pro Preview | 44,7% |
| #7 | GPT-5.5 (xhigh) | OpenAI | 44,3% |
| #8 | GPT-5.6 Sol (high) | OpenAI | 44,1% |
| #9 | GPT-5.5 (high) | OpenAI | 43% |
| #10 | GPT-5.6 Terra (max) | OpenAI | 41,8% |
| #11 | GPT-5.4 (xhigh) | OpenAI | 41,6% |
| #12 | Gemini 3.5 Flash (high) | 41% |
| #13 | GPT-5.5 (medium) | OpenAI | 40,6% |
| #14 | Grok 4.5 (high) | SpaceXAI | 40,3% |
| #15 | GLM-5.2 (max) | Z AI | 40,1% |
| #16 | GPT-5.6 Terra (xhigh) | OpenAI | 40% |
| #17 | GPT-5.3 Codex (xhigh) | OpenAI | 39,9% |
| #18 | Muse Spark | Meta | 39,9% |
| #19 | Gemini 3.5 Flash (medium) | 39,9% |
| #20 | GPT-5.6 Sol (medium) | OpenAI | 39,7% |