Easy Benchmarks
Workspace
Overview
Benchmarks
Benchmarks list
Compare
Overall Index
Coding
Math
MMLU-Pro
Speed
Value
LLMs
Audio
Image
Video
Log inSign up
Back

SciCode

Scientific coding benchmark score.

SciCode converts real scientific research problems into coding tasks. The project reports 80 main problems decomposed into 338 subproblems across scientific domains, requiring knowledge recall, reasoning, and code synthesis.

Test type: Research coding benchmark with scientist-authored solutions and test cases.

Coverage

549 models have this metric.

60.2%

Current leader: Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)

Project links

This app ranks the SciCode score exposed by the Artificial Analysis snapshot.

Artificial Analysis resultsOfficial websiteGitHub

Top SciCode Models

Top models ranked by SciCode.

Leaderboard

RankModelCreatorValueSpeedBlended Price
#1Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic60.2%59.9 tok/s$20.00/M
#2
Gemini 3.1 Pro Preview
Google
58.9%
134.1 tok/s
$4.50/M
#3Kimi K3 (max)Kimi58.7%33.5 tok/s$6.00/M
#4Muse Spark 1.1 (xhigh)Meta58.2%139.7 tok/s$2.00/M
#5GPT-5.6 Sol (high)OpenAI56.9%65.8 tok/s$11.25/M
#6GPT-5.4 (xhigh)OpenAI56.6%n/a$5.63/M
#7GPT-5.6 Sol (medium)OpenAI56.5%57.6 tok/s$11.25/M
#8Gemini 3 Pro Preview (high)Google56.1%n/a$4.50/M
#9GPT-5.5 (xhigh)OpenAI56.1%n/a$11.25/M
#10GPT-5.6 Sol (max)OpenAI56.1%68.1 tok/s$11.25/M
#11GPT-5.6 Sol (xhigh)OpenAI56.0%62.8 tok/s$11.25/M
#12GPT-5.5 (high)OpenAI55.9%n/a$11.25/M
#13Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic55.7%56.2 tok/s$10.00/M
#14GPT-5.6 Sol (low)OpenAI55.4%59.1 tok/s$11.25/M
#15Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic55.0%53.5 tok/s$10.00/M
#16GPT-5.2 Codex (xhigh)OpenAI54.6%n/a$4.81/M
#17Claude Opus 4.7 (Adaptive Reasoning, Max Effort)Anthropic54.5%n/a$10.00/M
#18Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic54.3%53.6 tok/s$10.00/M
#19Grok 4.5 (high)SpaceXAI54.1%53.3 tok/s$3.00/M
#20GPT-5.6 Terra (max)OpenAI53.9%132 tok/s$4.50/M
#21Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic53.6%83.6 tok/s$4.00/M
#22Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropic53.5%n/a$10.00/M
#23GPT-5.5 (medium)OpenAI53.5%n/a$11.25/M
#24Kimi K2.6Kimi53.5%n/a$1.71/M
#25GPT-5.3 Codex (xhigh)OpenAI53.2%109.1 tok/s$4.81/M
#26Gemini 3.5 Flash (high)Google53.1%220.6 tok/s$3.38/M
#27Gemini 3.5 Flash (medium)Google53.0%240.9 tok/s$3.38/M
#28Gemini 3.6 Flash (high)Google52.7%214.8 tok/s$3.00/M
#29GPT-5.6 Luna (max)OpenAI52.5%174.2 tok/s$0.450/M
#30GPT-5.2 (xhigh)OpenAI52.1%n/a$4.81/M
#31Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic51.9%n/a$10.00/M
#32GPT-5.5 (low)OpenAI51.6%n/a$11.25/M
#33GPT-5.6 Terra (xhigh)OpenAI51.6%109.7 tok/s$4.50/M
#34Muse SparkMeta51.5%n/a-
#35Kimi K3 (low)Kimi51.2%33.7 tok/s$6.00/M
#36Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic50.7%54.1 tok/s$10.00/M
#37GPT-5.6 Luna (high)OpenAI50.7%172.1 tok/s$0.450/M
#38Gemini 3 Flash Preview (Reasoning)Google50.6%n/a$1.13/M
#39GLM-5.2 (max)Z AI50.5%99.9 tok/s$2.15/M
#40GPT-5.4 (low)OpenAI50.3%n/a$5.63/M
#41GPT-5.5 Instant (May 2026)OpenAI50.3%n/a$11.25/M
#42Grok Build 0.1 0616SpaceXAI50.2%n/a$1.25/M
#43MiMo-V2.5-ProXiaomi50.2%44.2 tok/s$0.544/M
#44Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic50.1%n/a$10.00/M
#45GPT-5.6 Terra (high)OpenAI50.1%117.9 tok/s$4.50/M
#46DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek50.0%59.6 tok/s$0.544/M
#47GPT-5.6 Luna (xhigh)OpenAI50.0%174 tok/s$0.450/M
#48DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek49.9%n/a$0.175/M
#49Gemini 3 Flash Preview (Non-reasoning)Google49.9%n/a$1.13/M
#50Gemini 3 Pro Preview (low)Google49.9%n/a$4.50/M
#51GPT-5.4 mini (xhigh)OpenAI49.9%n/a$1.69/M
#52GPT-5.6 Terra (medium)OpenAI49.7%111.6 tok/s$4.50/M
#53Claude Opus 4.5 (Reasoning)Anthropic49.5%n/a$10.00/M
#54GPT-5.6 Terra (low)OpenAI49.2%115.7 tok/s$4.50/M
#55Kimi K2.5 (Reasoning)Kimi49.0%n/a$1.20/M
#56Gemini 3.5 Flash (minimal)Google48.8%223.3 tok/s$3.38/M
#57Qwen3.7 MaxAlibaba48.8%202 tok/s$3.75/M
#58TMInkling SmallThinking Machines48.7%95.3 tok/s$0.525/M
#59Claude Sonnet 5 (Non-reasoning, High Effort)Anthropic48.6%69.2 tok/s$4.00/M
#60GPT-5.5 Instant (June 2026)OpenAI48.6%n/a$11.25/M
#61Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic48.0%53.9 tok/s$10.00/M
#62TEHy3Tencent47.6%72.2 tok/s$0.241/M
#63Kimi K2.7 CodeKimi47.5%39.1 tok/s$1.71/M
#64GPT-5.5 (Non-reasoning)OpenAI47.3%n/a$11.25/M
#65Grok 4.3 (high)SpaceXAI47.3%n/a$1.56/M
#66GPT-5.4 (Non-reasoning)OpenAI47.1%n/a$5.63/M
#67GPT-5.6 Sol (Non-reasoning)OpenAI47.1%62.3 tok/s$11.25/M
#68Claude Opus 4.5 (Non-reasoning)Anthropic47.0%n/a$10.00/M
#69MiniMax-M2.7MiniMax47.0%n/a$0.525/M
#70Claude Sonnet 4.6 (Non-reasoning, High Effort)Anthropic46.9%n/a$6.00/M
#71GPT-5.4 nano (xhigh)OpenAI46.9%n/a$0.463/M
#72Qwen3.6 Max PreviewAlibaba46.9%n/a$2.93/M
#73Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic46.8%n/a$6.00/M
#74o4-mini (high)OpenAI46.5%n/a$1.93/M
#75DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek46.4%55.3 tok/s$0.544/M
#76GLM-5 (Reasoning)Z AI46.2%n/a$1.55/M
#77GPT-5.2 (medium)OpenAI46.2%n/a$4.81/M
#78TMInkling (xhigh)Thinking Machines46.1%79.3 tok/s$2.57/M
#79GPT-5.6 Luna (medium)OpenAI45.8%158.4 tok/s$0.450/M
#80Claude Opus 4.6 (Non-reasoning, High Effort)Anthropic45.7%n/a$10.00/M