Scientific coding benchmark score.
SciCode converts real scientific research problems into coding tasks. The project reports 80 main problems decomposed into 338 subproblems across scientific domains, requiring knowledge recall, reasoning, and code synthesis.
Test type: Research coding benchmark with scientist-authored solutions and test cases.
549 models have this metric.
Current leader: Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)
Project links
This app ranks the SciCode score exposed by the Artificial Analysis snapshot.
Top models ranked by SciCode.
| Rank | Model | Creator | Value | Speed | Blended Price |
|---|---|---|---|---|---|
| #1 | Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | Anthropic | 60.2% | 59.9 tok/s | $20.00/M |
| #2 |
| 58.9% |
| 134.1 tok/s |
| $4.50/M |
| #3 | Kimi K3 (max) | Kimi | 58.7% | 33.5 tok/s | $6.00/M |
| #4 | Muse Spark 1.1 (xhigh) | Meta | 58.2% | 139.7 tok/s | $2.00/M |
| #5 | GPT-5.6 Sol (high) | OpenAI | 56.9% | 65.8 tok/s | $11.25/M |
| #6 | GPT-5.4 (xhigh) | OpenAI | 56.6% | n/a | $5.63/M |
| #7 | GPT-5.6 Sol (medium) | OpenAI | 56.5% | 57.6 tok/s | $11.25/M |
| #8 | Gemini 3 Pro Preview (high) | 56.1% | n/a | $4.50/M |
| #9 | GPT-5.5 (xhigh) | OpenAI | 56.1% | n/a | $11.25/M |
| #10 | GPT-5.6 Sol (max) | OpenAI | 56.1% | 68.1 tok/s | $11.25/M |
| #11 | GPT-5.6 Sol (xhigh) | OpenAI | 56.0% | 62.8 tok/s | $11.25/M |
| #12 | GPT-5.5 (high) | OpenAI | 55.9% | n/a | $11.25/M |
| #13 | Claude Opus 5 (Adaptive Reasoning, Max Effort) | Anthropic | 55.7% | 56.2 tok/s | $10.00/M |
| #14 | GPT-5.6 Sol (low) | OpenAI | 55.4% | 59.1 tok/s | $11.25/M |
| #15 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | Anthropic | 55.0% | 53.5 tok/s | $10.00/M |
| #16 | GPT-5.2 Codex (xhigh) | OpenAI | 54.6% | n/a | $4.81/M |
| #17 | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) | Anthropic | 54.5% | n/a | $10.00/M |
| #18 | Claude Opus 5 (Adaptive Reasoning, High Effort) | Anthropic | 54.3% | 53.6 tok/s | $10.00/M |
| #19 | Grok 4.5 (high) | SpaceXAI | 54.1% | 53.3 tok/s | $3.00/M |
| #20 | GPT-5.6 Terra (max) | OpenAI | 53.9% | 132 tok/s | $4.50/M |
| #21 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | Anthropic | 53.6% | 83.6 tok/s | $4.00/M |
| #22 | Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | Anthropic | 53.5% | n/a | $10.00/M |
| #23 | GPT-5.5 (medium) | OpenAI | 53.5% | n/a | $11.25/M |
| #24 | Kimi K2.6 | Kimi | 53.5% | n/a | $1.71/M |
| #25 | GPT-5.3 Codex (xhigh) | OpenAI | 53.2% | 109.1 tok/s | $4.81/M |
| #26 | Gemini 3.5 Flash (high) | 53.1% | 220.6 tok/s | $3.38/M |
| #27 | Gemini 3.5 Flash (medium) | 53.0% | 240.9 tok/s | $3.38/M |
| #28 | Gemini 3.6 Flash (high) | 52.7% | 214.8 tok/s | $3.00/M |
| #29 | GPT-5.6 Luna (max) | OpenAI | 52.5% | 174.2 tok/s | $0.450/M |
| #30 | GPT-5.2 (xhigh) | OpenAI | 52.1% | n/a | $4.81/M |
| #31 | Claude Opus 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 51.9% | n/a | $10.00/M |
| #32 | GPT-5.5 (low) | OpenAI | 51.6% | n/a | $11.25/M |
| #33 | GPT-5.6 Terra (xhigh) | OpenAI | 51.6% | 109.7 tok/s | $4.50/M |
| #34 | Muse Spark | Meta | 51.5% | n/a | - |
| #35 | Kimi K3 (low) | Kimi | 51.2% | 33.7 tok/s | $6.00/M |
| #36 | Claude Opus 5 (Adaptive Reasoning, Medium Effort) | Anthropic | 50.7% | 54.1 tok/s | $10.00/M |
| #37 | GPT-5.6 Luna (high) | OpenAI | 50.7% | 172.1 tok/s | $0.450/M |
| #38 | Gemini 3 Flash Preview (Reasoning) | 50.6% | n/a | $1.13/M |
| #39 | GLM-5.2 (max) | Z AI | 50.5% | 99.9 tok/s | $2.15/M |
| #40 | GPT-5.4 (low) | OpenAI | 50.3% | n/a | $5.63/M |
| #41 | GPT-5.5 Instant (May 2026) | OpenAI | 50.3% | n/a | $11.25/M |
| #42 | Grok Build 0.1 0616 | SpaceXAI | 50.2% | n/a | $1.25/M |
| #43 | MiMo-V2.5-Pro | Xiaomi | 50.2% | 44.2 tok/s | $0.544/M |
| #44 | Claude Opus 4.7 (Non-reasoning, High Effort) | Anthropic | 50.1% | n/a | $10.00/M |
| #45 | GPT-5.6 Terra (high) | OpenAI | 50.1% | 117.9 tok/s | $4.50/M |
| #46 | DeepSeek V4 Pro (Reasoning, Max Effort) | DeepSeek | 50.0% | 59.6 tok/s | $0.544/M |
| #47 | GPT-5.6 Luna (xhigh) | OpenAI | 50.0% | 174 tok/s | $0.450/M |
| #48 | DeepSeek V4 Flash 0731 (Reasoning, Max Effort) | DeepSeek | 49.9% | n/a | $0.175/M |
| #49 | Gemini 3 Flash Preview (Non-reasoning) | 49.9% | n/a | $1.13/M |
| #50 | Gemini 3 Pro Preview (low) | 49.9% | n/a | $4.50/M |
| #51 | GPT-5.4 mini (xhigh) | OpenAI | 49.9% | n/a | $1.69/M |
| #52 | GPT-5.6 Terra (medium) | OpenAI | 49.7% | 111.6 tok/s | $4.50/M |
| #53 | Claude Opus 4.5 (Reasoning) | Anthropic | 49.5% | n/a | $10.00/M |
| #54 | GPT-5.6 Terra (low) | OpenAI | 49.2% | 115.7 tok/s | $4.50/M |
| #55 | Kimi K2.5 (Reasoning) | Kimi | 49.0% | n/a | $1.20/M |
| #56 | Gemini 3.5 Flash (minimal) | 48.8% | 223.3 tok/s | $3.38/M |
| #57 | Qwen3.7 Max | Alibaba | 48.8% | 202 tok/s | $3.75/M |
| #58 | Inkling Small | Thinking Machines | 48.7% | 95.3 tok/s | $0.525/M |
| #59 | Claude Sonnet 5 (Non-reasoning, High Effort) | Anthropic | 48.6% | 69.2 tok/s | $4.00/M |
| #60 | GPT-5.5 Instant (June 2026) | OpenAI | 48.6% | n/a | $11.25/M |
| #61 | Claude Opus 5 (Adaptive Reasoning, Low Effort) | Anthropic | 48.0% | 53.9 tok/s | $10.00/M |
| #62 | Hy3 | Tencent | 47.6% | 72.2 tok/s | $0.241/M |
| #63 | Kimi K2.7 Code | Kimi | 47.5% | 39.1 tok/s | $1.71/M |
| #64 | GPT-5.5 (Non-reasoning) | OpenAI | 47.3% | n/a | $11.25/M |
| #65 | Grok 4.3 (high) | SpaceXAI | 47.3% | n/a | $1.56/M |
| #66 | GPT-5.4 (Non-reasoning) | OpenAI | 47.1% | n/a | $5.63/M |
| #67 | GPT-5.6 Sol (Non-reasoning) | OpenAI | 47.1% | 62.3 tok/s | $11.25/M |
| #68 | Claude Opus 4.5 (Non-reasoning) | Anthropic | 47.0% | n/a | $10.00/M |
| #69 | MiniMax-M2.7 | MiniMax | 47.0% | n/a | $0.525/M |
| #70 | Claude Sonnet 4.6 (Non-reasoning, High Effort) | Anthropic | 46.9% | n/a | $6.00/M |
| #71 | GPT-5.4 nano (xhigh) | OpenAI | 46.9% | n/a | $0.463/M |
| #72 | Qwen3.6 Max Preview | Alibaba | 46.9% | n/a | $2.93/M |
| #73 | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 46.8% | n/a | $6.00/M |
| #74 | o4-mini (high) | OpenAI | 46.5% | n/a | $1.93/M |
| #75 | DeepSeek V4 Pro (Reasoning, High Effort) | DeepSeek | 46.4% | 55.3 tok/s | $0.544/M |
| #76 | GLM-5 (Reasoning) | Z AI | 46.2% | n/a | $1.55/M |
| #77 | GPT-5.2 (medium) | OpenAI | 46.2% | n/a | $4.81/M |
| #78 | Inkling (xhigh) | Thinking Machines | 46.1% | 79.3 tok/s | $2.57/M |
| #79 | GPT-5.6 Luna (medium) | OpenAI | 45.8% | 158.4 tok/s | $0.450/M |
| #80 | Claude Opus 4.6 (Non-reasoning, High Effort) | Anthropic | 45.7% | n/a | $10.00/M |