Easy Benchmarks
Workspace
Overview
Benchmarks
Benchmarks list
Compare
Overall Index
Coding
Math
MMLU-Pro
Speed
Value
LLMs
Audio
Image
Video
Log inSign up
Back

SciCode

Scientific coding benchmark score.

SciCode converts real scientific research problems into coding tasks. The project reports 80 main problems decomposed into 338 subproblems across scientific domains, requiring knowledge recall, reasoning, and code synthesis.

Test type: Research coding benchmark with scientist-authored solutions and test cases.

Coverage

534 models have this metric.

60.2%

Current leader: Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)

Project links

This app ranks the SciCode score exposed by the Artificial Analysis snapshot.

Artificial Analysis resultsOfficial websiteGitHub

Top SciCode Models

Top models ranked by SciCode.

Leaderboard

RankModelCreatorValueSpeedBlended Price
#1Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic60.2%69.4 tok/s$20.00/M
#2
Gemini 3.1 Pro Preview
Google
58.9%
123.1 tok/s
$4.50/M
#3Muse Spark 1.1 (xhigh)Meta58.2%124.3 tok/s$2.00/M
#4GPT-5.6 Sol (high)OpenAI56.9%56.2 tok/s$11.25/M
#5GPT-5.4 (xhigh)OpenAI56.6%154.5 tok/s$5.63/M
#6GPT-5.6 Sol (medium)OpenAI56.5%55.6 tok/s$11.25/M
#7GPT-5.6 Sol (max)OpenAI56.1%67.4 tok/s$11.25/M
#8GPT-5.5 (xhigh)OpenAI56.1%73.9 tok/s$11.25/M
#9Gemini 3 Pro Preview (high)Google56.1%n/a$4.50/M
#10GPT-5.6 Sol (xhigh)OpenAI56.0%57 tok/s$11.25/M
#11GPT-5.5 (high)OpenAI55.9%58.4 tok/s$11.25/M
#12GPT-5.6 Sol (low)OpenAI55.4%57.1 tok/s$11.25/M
#13GPT-5.2 Codex (xhigh)OpenAI54.6%125.5 tok/s$4.81/M
#14Claude Opus 4.7 (Adaptive Reasoning, Max Effort)Anthropic54.5%49.5 tok/s$10.00/M
#15Grok 4.5 (high)SpaceXAI54.1%122.8 tok/s$3.00/M
#16GPT-5.6 Terra (max)OpenAI53.9%170.1 tok/s$5.63/M
#17Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic53.6%89.2 tok/s$4.00/M
#18GPT-5.5 (medium)OpenAI53.5%58.3 tok/s$11.25/M
#19Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropic53.5%54.3 tok/s$10.00/M
#20Kimi K2.6Kimi53.5%39.2 tok/s$1.71/M
#21GPT-5.3 Codex (xhigh)OpenAI53.2%95.4 tok/s$4.81/M
#22Gemini 3.5 Flash (high)Google53.1%241.2 tok/s$3.38/M
#23Gemini 3.5 Flash (medium)Google53.0%234.7 tok/s$3.38/M
#24GPT-5.6 Luna (max)OpenAI52.5%243.6 tok/s$2.25/M
#25GPT-5.2 (xhigh)OpenAI52.1%80.5 tok/s$4.81/M
#26Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic51.9%49.5 tok/s$10.00/M
#27GPT-5.6 Terra (xhigh)OpenAI51.6%117.6 tok/s$5.63/M
#28GPT-5.5 (low)OpenAI51.6%56.8 tok/s$11.25/M
#29Muse SparkMeta51.5%n/a-
#30GPT-5.6 Luna (high)OpenAI50.7%191.2 tok/s$2.25/M
#31Gemini 3 Flash Preview (Reasoning)Google50.6%197.7 tok/s$1.13/M
#32GLM-5.2 (max)Z AI50.5%149.2 tok/s$2.15/M
#33GPT-5.4 (low)OpenAI50.3%98.2 tok/s$5.63/M
#34GPT-5.5 Instant (May 2026)OpenAI50.3%n/a$11.25/M
#35Grok Build 0.1 0616SpaceXAI50.2%46.3 tok/s$1.25/M
#36MiMo-V2.5-ProXiaomi50.2%57.1 tok/s$0.544/M
#37GPT-5.6 Terra (high)OpenAI50.1%109.5 tok/s$5.63/M
#38Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic50.1%43 tok/s$10.00/M
#39GPT-5.6 Luna (xhigh)OpenAI50.0%185.7 tok/s$2.25/M
#40DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek50.0%63.7 tok/s$0.544/M
#41GPT-5.4 mini (xhigh)OpenAI49.9%167.5 tok/s$1.69/M
#42Gemini 3 Flash Preview (Non-reasoning)Google49.9%195.8 tok/s$1.13/M
#43Gemini 3 Pro Preview (low)Google49.9%n/a$4.50/M
#44GPT-5.6 Terra (medium)OpenAI49.7%103.3 tok/s$5.63/M
#45Claude Opus 4.5 (Reasoning)Anthropic49.5%58.5 tok/s$10.00/M
#46GPT-5.6 Terra (low)OpenAI49.2%102.3 tok/s$5.63/M
#47Kimi K2.5 (Reasoning)Kimi49.0%46.8 tok/s$1.20/M
#48Gemini 3.5 Flash (minimal)Google48.8%201.4 tok/s$3.38/M
#49Qwen3.7 MaxAlibaba48.8%198.9 tok/s$3.75/M
#50GPT-5.5 Instant (June 2026)OpenAI48.6%n/a$11.25/M
#51Claude Sonnet 5 (Non-reasoning, High Effort)Anthropic48.6%57.9 tok/s$4.00/M
#52TEHy3Tencent47.6%48 tok/s-
#53Kimi K2.7 CodeKimi47.5%43 tok/s$1.71/M
#54GPT-5.5 (Non-reasoning)OpenAI47.3%57.4 tok/s$11.25/M
#55Grok 4.3 (high)SpaceXAI47.3%112.5 tok/s$1.56/M
#56GPT-5.6 Sol (Non-reasoning)OpenAI47.1%45.3 tok/s$11.25/M
#57GPT-5.4 (Non-reasoning)OpenAI47.1%97.5 tok/s$5.63/M
#58MiniMax-M2.7MiniMax47.0%48.6 tok/s$0.525/M
#59Claude Opus 4.5 (Non-reasoning)Anthropic47.0%51.8 tok/s$10.00/M
#60GPT-5.4 nano (xhigh)OpenAI46.9%161.4 tok/s$0.463/M
#61Claude Sonnet 4.6 (Non-reasoning, High Effort)Anthropic46.9%46.4 tok/s$6.00/M
#62Qwen3.6 Max PreviewAlibaba46.9%37 tok/s$2.93/M
#63Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic46.8%72 tok/s$6.00/M
#64o4-mini (high)OpenAI46.5%162.3 tok/s$1.93/M
#65DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek46.4%57.6 tok/s$0.544/M
#66GPT-5.2 (medium)OpenAI46.2%n/a$4.81/M
#67GLM-5 (Reasoning)Z AI46.2%46.2 tok/s$1.55/M
#68TMInkling (xhigh)Thinking Machines46.1%82.9 tok/s$2.57/M
#69GPT-5.6 Luna (medium)OpenAI45.8%185.8 tok/s$2.25/M
#70Claude Opus 4.6 (Non-reasoning, High Effort)Anthropic45.7%44.4 tok/s$10.00/M
#71Grok 4SpaceXAI45.7%n/a$11.00/M
#72GPT-5.6 Luna (low)OpenAI45.6%170.7 tok/s$2.25/M
#73Grok 4.20 0309 v2 (Reasoning)SpaceXAI45.6%159.2 tok/s$3.00/M
#74Qwen3.7 PlusAlibaba45.5%52.4 tok/s$0.700/M
#75MiniMax-M3MiniMax45.4%94.8 tok/s$0.525/M
#76GLM-4.7 (Reasoning)Z AI45.1%101.5 tok/s$1.00/M
#77DeepSeek V4 Flash (Reasoning, Max Effort)DeepSeek44.9%101.1 tok/s$0.175/M
#78Claude 4.5 Sonnet (Reasoning)Anthropic44.7%50 tok/s$6.00/M
#79Grok 4.20 0309 (Reasoning)SpaceXAI44.7%n/a$3.00/M
#80GPT-5.6 Terra (Non-reasoning)OpenAI44.6%101.7 tok/s$5.63/M