Zum Inhalt springen
Easy Benchmarks
Beste ModelleToolsAnbieterUpdatesVollständige Benchmarks öffnen
EnglishFrançaisEspañolDeutschPortuguês

Easy Benchmarks

Sag uns, was du erreichen möchtest. Easy Benchmarks übersetzt aktuelle Benchmark-, Preis- und Geschwindigkeitsdaten in eine einfache Auswahl.

Benchmark data is attributed to Artificial Analysis. Model metadata and catalog pricing may also use Vercel AI Gateway data when available.

Aktueller BerichtBenchmark-GlossarMethodikllms.txt

Beste Modelle

Bestes KI-Modell für MMLU-Pro

Gemini 3.1 Pro Preview ist derzeit das bestplatzierte Modell für MMLU-Pro in den verfügbaren Daten.

Vollständige Benchmarks öffnenKI-Modellfinder
Aktueller Spitzenreiter
Gemini 3.1 Pro Preview
Wert
91,2%
Datensatzabdeckung
356
Aktualisiert
16.07.2026

So nutzt du dieses Ergebnis

  1. 1

    Mit dem Spitzenreiter beginnen

    Nutze den Erstplatzierten als Ausgangspunkt, nicht als automatische Entscheidung.

  2. 2

    Die besten Optionen prüfen

    Vergleiche die ersten Modelle bei Preis, Geschwindigkeit und Verfügbarkeit.

  3. 3

    Die Quelle prüfen

    Öffne die verlinkte Ergebnisseite und Methodik, bevor du das Ergebnis zitierst.

Top-Modelle

MMLU-Pro measures broad knowledge and reasoning with harder multiple-choice questions than classic MMLU.

RangModellAnbieterWert
#1Gemini 3.1 Pro PreviewGoogle91,2%
#2Gemini 3 Pro Preview (high)Google89,8%
#3Gemini 3 Pro Preview (low)Google89,5%
#4Claude Opus 4.5 (Reasoning)Anthropic89,5%
#5Gemini 3 Flash Preview (Reasoning)Google89%

Daten & Nachweise

This answer uses the exact same metric and live database ranking as the linked Easy Benchmarks leaderboard.

Quelle: Artificial Analysis MMLU-Pro. Aktualisiert: 16.07.2026.

View the live benchmark resultsView the original result pageRead the benchmark methodology

Verwandte Seiten

Bestes KI-Modell für allgemeine LeistungBestes KI-Modell für ProgrammierungBestes KI-Modell für MathematikBestes KI-Modell für Schlussfolgern und WissenBestes KI-Modell für GeschwindigkeitBestes KI-Modell für Preis-Leistung
#6Claude Opus 4.5 (Non-reasoning)Anthropic88,9%
#7Gemini 3 Flash Preview (Non-reasoning)Google88,2%
#8Claude 4.1 Opus (Reasoning)Anthropic88%
#9Claude 4.5 Sonnet (Reasoning)Anthropic87,5%
#10MiniMax-M2.1MiniMax87,5%
#11GPT-5.2 (xhigh)OpenAI87,4%
#12Claude 4 Opus (Reasoning)Anthropic87,3%
#13GPT-5 (high)OpenAI87,1%
#14GPT-5.1 (high)OpenAI87%
#15GPT-5 (medium)OpenAI86,7%
#16Grok 4SpaceXAI86,6%
#17GPT-5 Codex (high)OpenAI86,5%
#18DeepSeek V3.2 SpecialeDeepSeek86,3%
#19Gemini 3.1 Flash-LiteGoogle86,2%
#20Gemini 2.5 ProGoogle86,2%