Melhores modelos
GPT-5 (high) é atualmente o modelo mais bem classificado para matemática nos dados disponíveis.
Use o modelo líder como ponto de partida, não como decisão automática.
Compare as melhores opções por preço, velocidade, disponibilidade e limites.
Abra a página de resultados e a metodologia antes de citar o ranking.
MATH-500 measures mathematical problem solving on a curated set of competition-style questions.
| Posição | Modelo | Fornecedor | Valor |
|---|---|---|---|
| #1 | GPT-5 (high) | OpenAI | 99,4% |
| #2 | o3 | OpenAI | 99,2% |
| #3 | Grok 3 mini Reasoning (high) | SpaceXAI | 99,2% |
| #4 | GPT-5 (medium) | OpenAI | 99,1% |
| #5 | Claude 4 Sonnet (Reasoning) | Anthropic | 99,1% |
This answer uses the exact same metric and live database ranking as the linked Easy Benchmarks leaderboard.
Fonte: Artificial Analysis MATH-500. Atualizado: 16 de jul. de 2026.
| #6 |
| Grok 4 |
| SpaceXAI |
| 99% |
| #7 | o4-mini (high) | OpenAI | 98,9% |
| #8 | GPT-5 (low) | OpenAI | 98,7% |
| #9 | Gemini 2.5 Pro Preview (May' 25) | 98,6% |
| #10 | o3-mini (high) | OpenAI | 98,5% |
| #11 | Qwen3 235B A22B 2507 (Reasoning) | Alibaba | 98,4% |
| #12 | Llama Nemotron Super 49B v1.5 (Reasoning) | NVIDIA | 98,3% |
| #13 | DeepSeek R1 0528 (May '25) | DeepSeek | 98,3% |
| #14 | Claude 4 Opus (Reasoning) | Anthropic | 98,2% |
| #15 | Gemini 2.5 Flash (Reasoning) | 98,1% |
| #16 | Gemini 2.5 Flash Preview (Reasoning) | 98,1% |
| #17 | Gemini 2.5 Pro Preview (Mar' 25) | 98% |
| #18 | MiniMax M1 80k | MiniMax | 98% |
| #19 | Qwen3 235B A22B 2507 Instruct | Alibaba | 98% |
| #20 | GLM-4.5 (Reasoning) | Z AI | 97,9% |