/ LLM benchmarks / Coding
Coding benchmarks
Code generation and web development tasks from Code Arena (Elo) and LiveBench.
DataCode Arena1 Oct 2026LiveBenchrelease 2026-06-25fetched
Code Arena
View original source| # | Model | Score |
|---|---|---|
| 1 | Claude Opus 5.5 MaxAnthropic | 1815Elo +16/-16 |
| 2 | GPT-6 Astra MaxOpenAI | 1788Elo +10/-10 |
| 3 | Claude Sonnet 5.5 xHighAnthropic | 1786Elo +18/-18 |
| 4 | GPT-6.1 Sol MaxOpenAI | 1758Elo +17/-17 |
| 5 | Claude Fable 5.1 MaxAnthropic | 1749Elo +10/-10 |
| 6 | Claude Sonnet 5.5 HighAnthropic | 1715Elo +13/-13 |
| 7 | Claude Opus 5 MaxAnthropic | 1695Elo +6/-6 |
| 8 | GPT-6 Sol MaxOpenAI | 1689Elo +11/-11 |
| 9 | Gemini 4 Argon HighGoogle | 1680Elo +13/-13 |
| 10 | Qwen 3.8 MaxAlibaba | 1671Elo +12/-12 |
| 11 | Qwen 3.8 Max 0902Alibaba | 1670Elo +8/-8 |
| 12 | Claude Opus 5 HighAnthropic | 1660Elo +6/-6 |
| 13 | Kimi K3 MaxMoonshot AI | 1658Elo +6/-6 |
| 14 | 1657Elo +9/-9 | |
| 15 | Grok 4.7 xHighSpaceXAI | 1638Elo +12/-12 |
| 16 | Qwen 3.8 Flash NextAlibaba | 1637Elo +9/-9 |
| 17 | Hy4 PreviewTencent | 1633Elo +9/-9 |
| 18 | Claude Fable 5 HighAnthropic | 1625Elo +6/-6 |
| 19 | 1624Elo +9/-9 | |
| 20 | GLM-5.3 MaxZ.AI | 1623Elo +8/-8 |
| 21 | DeepSeek V4.1 Flash MaxDeepSeek | 1620Elo +10/-10 |
| 22 | 1620Elo +6/-6 | |
| 23 | Grok 4.6 HighSpaceXAI | 1620Elo +8/-8 |
| 24 | MiMo V2.6 ProXiaomi | 1618Elo +12/-12 |
| 25 | GLM-5.3 FlashZ.AI | 1616Elo +8/-8 |
| 26 | GLM-5.2 MaxZ.AI | 1605Elo +6/-6 |
| 27 | Gemini 3.7 Flash HighGoogle | 1592Elo +7/-7 |
| 28 | Qwen 3.8 27BAlibaba | 1591Elo +7/-7 |
| 29 | Gemini 3.8 Flash HighGoogle | 1583Elo +8/-8 |
| 30 | DeepSeek V4 Pro High 20260813DeepSeek | 1583Elo +9/-9 |
| 31 | DeepSeek V4 Flash HighDeepSeek | 1581Elo +9/-9 |
| 32 | GPT-6 Luna MaxOpenAI | 1579Elo +9/-9 |
| 33 | Step 5 Preview HighStepfun | 1570Elo +13/-13 |
| 34 | Claude Opus 4.7 HighAnthropic | 1557Elo +6/-6 |
| 35 | Claude Opus 4.8 HighAnthropic | 1556Elo +6/-6 |
| 36 | Claude Opus 4.7Anthropic | 1555Elo +6/-6 |
| 37 | Grok 4.5SpaceXAI | 1552Elo +7/-7 |
| 38 | Claude Opus 4.6 HighAnthropic | 1546Elo +5/-5 |
| 39 | Muse Spark 1.1Meta | 1542Elo +8/-8 |
| 40 | Claude Sonnet 5 HighAnthropic | 1539Elo +6/-6 |
| 41 | Claude Opus 4.6Anthropic | 1537Elo +5/-5 |
| 42 | Gemini 3.6 Flash HighGoogle | 1536Elo +7/-7 |
| 43 | Claude Opus 4.8Anthropic | 1534Elo +6/-6 |
| 44 | 1532Elo +14/-14 | |
| 45 | Claude Sonnet 4.6Anthropic | 1521Elo +5/-5 |
| 46 | 1519Elo +7/-7 | |
| 47 | 1518Elo +6/-6 | |
| 48 | Seed 2.1 Pro PreviewBytedance | 1517Elo +6/-6 |
| 49 | Qwen 3.7 Max 20260517Alibaba | 1515Elo +7/-7 |
| 50 | 1512Elo +6/-6 | |
| 51 | Kimi K2.6Moonshot AI | 1509Elo +7/-7 |
| 52 | GLM-5.1Z.AI | 1508Elo +7/-7 |
| 53 | Hy3Tencent | 1507Elo +9/-9 |
| 54 | Gemini 3.5 Flash HighGoogle | 1499Elo +7/-7 |
| 55 | Claude Opus 4.5 20251101 High 32KAnthropic | 1493Elo +8/-8 |
| 56 | Gemini 3.5 Flash MediumGoogle | 1490Elo +7/-7 |
| 57 | 1487Elo +6/-6 | |
| 58 | MiniMax M3MiniMax | 1482Elo +6/-6 |
| 59 | Qwen 3.6 Max PreviewAlibaba | 1482Elo +13/-13 |
| 60 | MiMo V2.5 ProXiaomi | 1478Elo +5/-5 |
| 61 | Kimi K2.7 CodeMoonshot AI | 1473Elo +9/-9 |
| 62 | Claude Opus 4.5 20251101Anthropic | 1468Elo +7/-7 |
| 63 | 1465Elo +19/-19 | |
| 64 | DeepSeek V4 Pro High PreviewDeepSeek | 1463Elo +6/-6 |
| 65 | Qwen 3.6 PlusAlibaba | 1461Elo +6/-6 |
| 66 | GPT-5.5 (codex-harness)OpenAI | 1456Elo +6/-6 |
| 67 | Gemini 3.1 Pro PreviewGoogle | 1446Elo +5/-5 |
| 68 | DeepSeek V4 ProDeepSeek | 1446Elo +6/-6 |
| 69 | 1444Elo +18/-18 | |
| 70 | Gemini 3.5 Flash LiteGoogle | 1440Elo +41/-41 |
| 71 | Gemini 3 ProGoogle | 1439Elo +8/-8 |
| 72 | Gemini 3 FlashGoogle | 1439Elo +9/-9 |
| 73 | MiMo V2.5Xiaomi | 1438Elo +6/-6 |
| 74 | Kimi K2.5 ThinkingMoonshot AI | 1436Elo +5/-5 |
| 75 | GLM-4.7Z.AI | 1434Elo +12/-12 |
| 76 | GLM-5Z.AI | 1434Elo +8/-8 |
| 77 | MiMo V2 ProXiaomi | 1433Elo +8/-8 |
| 78 | DeepSeek V4 Flash High PreviewDeepSeek | 1430Elo +7/-7 |
| 79 | GPT-5 MediumOpenAI | 1417Elo +16/-16 |
| 80 | GPT-5.2OpenAI | 1415Elo +22/-22 |
| 81 | InklingThinking Machines | 1413Elo +6/-6 |
| 82 | Inkling SmallThinking Machines | 1408Elo +9/-9 |
| 83 | 1408Elo +14/-14 | |
| 84 | Kimi K2.5 InstantMoonshot AI | 1404Elo +12/-12 |
| 85 | GLM-5v TurboZ.AI | 1400Elo +13/-13 |
| 86 | Qwen 3.5 397B A17BAlibaba | 1399Elo +5/-5 |
| 87 | GPT-5.4 Mini HighOpenAI | 1397Elo +7/-7 |
| 88 | MiniMax M2.7MiniMax | 1397Elo +6/-6 |
| 89 | GPT-5.4OpenAI | 1395Elo +11/-11 |
| 90 | GPT-5.1 MediumOpenAI | 1395Elo +11/-11 |
| 91 | Claude Sonnet 4.5 20250929 High 32KAnthropic | 1393Elo +8/-8 |
| 92 | Claude Opus 4.1 20250805Anthropic | 1389Elo +11/-11 |
| 93 | MiniMax M2.5MiniMax | 1386Elo +8/-8 |
| 94 | Claude Sonnet 4.5 20250929Anthropic | 1384Elo +7/-7 |
| 95 | 1384Elo +5/-5 | |
| 96 | MiniMax M2.1 PreviewMiniMax | 1384Elo +10/-10 |
| 97 | Grok 4.20 Beta 0309 ReasoningSpaceXAI | 1374Elo +6/-6 |
| 98 | 1371Elo +11/-11 | |
| 99 | Solar Pro4Upstage | 1370Elo +10/-10 |
| 100 | Gemma 4 31BGoogle | 1365Elo +6/-6 |
| 101 | DeepSeek V3.2 ThinkingDeepSeek | 1362Elo +9/-9 |
| 102 | Qwen 3.5 122B A10BAlibaba | 1360Elo +8/-8 |
| 103 | Gemma 4 26B A4BGoogle | 1358Elo +17/-17 |
| 104 | Qwen 3.5 27BAlibaba | 1357Elo +8/-8 |
| 105 | Grok 4.3SpaceXAI | 1357Elo +6/-6 |
| 106 | Hunyuan Hy3 PreviewTencent | 1356Elo +17/-17 |
| 107 | Muse GlimmerMeta | 1355Elo +16/-16 |
| 108 | Laguna M.1Poolside | 1348Elo +9/-9 |
| 109 | GPT-5.1OpenAI | 1341Elo +8/-8 |
| 110 | GLM-4.6Z.AI | 1339Elo +11/-11 |
| 111 | GPT-5.2 CodexOpenAI | 1339Elo +9/-9 |
| 112 | GPT-5.1 CodexOpenAI | 1337Elo +12/-12 |
| 113 | 1330Elo +10/-10 | |
| 114 | Claude Haiku 4.5 20251001Anthropic | 1329Elo +5/-5 |
| 115 | DeepSeek V3.2DeepSeek | 1325Elo +8/-8 |
| 116 | Kimi K2 Thinking TurboMoonshot AI | 1321Elo +7/-7 |
| 117 | Laguna Xs.2Poolside | 1302Elo +11/-11 |
| 118 | MiniMax M2MiniMax | 1297Elo +11/-11 |
| 119 | MiMo V2 Flash (thinking)Xiaomi | 1292Elo +16/-16 |
| 120 | 1274Elo +8/-8 | |
| 121 | DeepSeek V3.2 ExpDeepSeek | 1272Elo +13/-13 |
| 122 | Mistral Medium 3.5Mistral | 1263Elo +15/-15 |
| 123 | 1256Elo +7/-7 | |
| 124 | KAT Coder Pro V1Unknown | 1255Elo +19/-19 |
| 125 | Qwen 3.5 35B A3BAlibaba | 1253Elo +17/-17 |
| 126 | GPT-5.1 Codex MiniOpenAI | 1244Elo +22/-22 |
| 127 | Qwen 3.5 FlashAlibaba | 1243Elo +20/-20 |
| 128 | Grok 4.1 Fast ReasoningSpaceXAI | 1241Elo +11/-11 |
| 129 | Trinity Large ThinkingArcee AI | 1238Elo +20/-20 |
| 130 | Mistral Large 3Mistral | 1230Elo +25/-25 |
| 131 | Gemini 2.5 ProGoogle | 1227Elo +16/-16 |
| 132 | Grok 4.1 ThinkingSpaceXAI | 1214Elo +25/-25 |
| 133 | Devstral 2Mistral | 1196Elo +21/-21 |
| 134 | 1190Elo +18/-18 | |
| 135 | Mercury 2Inception AI | 1170Elo +24/-24 |
| 136 | Grok Code Fast 1SpaceXAI | 1167Elo +28/-28 |
| 137 | Grok 4 Fast ReasoningSpaceXAI | 1159Elo +27/-27 |
| 138 | Devstral Medium 2507Mistral | 1076Elo +31/-31 |
LiveBench Coding · CC BY-SA 4.0
View original source| # | Model | Score | Cost/solved task |
|---|---|---|---|
| 1 | Claude 5.5 Opus Thinking Max EffortAnthropic | 89.3% | $0.80 |
| 2 | Claude Sonnet 5.5 xHigh EffortAnthropic | 88.9% | $0.14 |
| 3 | Claude Fable 5.1 Max EffortAnthropic | 86.4% | $1.21 |
| 4 | Claude Fable 5 Max EffortAnthropic | 86.0% | $1.44 |
| 5 | GPT-5.6 Sol Max EffortOpenAI | 83.9% | $0.52 |
| 6 | GPT-5.2 CodexOpenAI | 83.6% | $0.19 |
| 7 | GPT-5.6 Luna Max EffortOpenAI | 82.9% | $0.17 |
| 8 | GPT-5.5 Thinking xHigh EffortOpenAI | 82.1% | $0.43 |
| 9 | Claude 4.7 Opus Thinking xHigh EffortAnthropic | 82.1% | $0.53 |
| 10 | GPT-6 Sol Max EffortOpenAI | 81.8% | $0.27 |
| 11 | Claude 4.8 Opus Thinking Max EffortAnthropic | 81.8% | $0.98 |
| 12 | Claude 5 Opus Thinking Max EffortAnthropic | 81.4% | $0.70 |
| 13 | Kimi K3Moonshot AI · open weights | 81.4% | $0.35 |
| 14 | Muse Spark 1.3 xHigh EffortMeta | 81.1% | $0.22 |
| 15 | Claude Sonnet 5 xHigh EffortAnthropic | 80.7% | $0.51 |
| 16 | GPT-6 Astra Max EffortOpenAI | 80.4% | $0.74 |
| 17 | GPT-6.1 Sol Max EffortOpenAI | 80.4% | $0.14 |
| 18 | DeepSeek V4.1 Flash Max EffortDeepSeek · open weights | 80.0% | $0.029 |
| 19 | GLM-5.2Z.AI · open weights | 79.7% | $0.23 |
| 20 | Claude 4.5 Opus Thinking High EffortAnthropic | 79.7% | $0.61 |
| 21 | Claude 4.6 Sonnet Thinking Medium EffortAnthropic | 79.3% | $0.31 |
| 22 | GLM-5.3Z.AI · open weights | 79.0% | $0.45 |
| 23 | GPT-6 Luna Max EffortOpenAI | 79.0% | $0.026 |
| 24 | GLM-5.3 FlashZ.AI · open weights | 79.0% | $0.031 |
| 25 | Gemini 3.7 Flash HighGoogle | 78.9% | $0.16 |
| 26 | Kimi K2.6 ThinkingMoonshot AI · open weights | 78.6% | $0.17 |
| 27 | GPT-5.6 Terra Max EffortOpenAI | 78.2% | $0.35 |
| 28 | Gemini 3.5 Flash HighGoogle | 78.2% | $0.25 |
| 29 | Claude 4.6 Opus Thinking High EffortAnthropic | 78.2% | $0.40 |
| 30 | Qwen 3.6 PlusAlibaba | 78.2% | $0.23 |
| 31 | Gemini 3.6 Flash HighGoogle | 77.9% | $0.23 |
| 32 | GPT-5.4 Thinking xHigh EffortOpenAI | 77.5% | $0.39 |
| 33 | Muse Spark 1.2 xHigh EffortMeta | 77.5% | $0.38 |
| 34 | DeepSeek V4 Pro 0813DeepSeek · open weights | 77.2% | $0.044 |
| 35 | Grok 4.7 xHighxAI | 77.2% | $0.72 |
| 36 | Muse Spark 1.1 xHigh EffortMeta | 77.2% | $0.20 |
| 37 | Grok 4.6 xHighxAI | 76.8% | $0.21 |
| 38 | Gemini 3.1 Pro Preview HighGoogle | 76.5% | $0.29 |
| 39 | GPT-5.2 HighOpenAI | 76.1% | $0.23 |
| 40 | Gemini 3.5 Flash-Lite HighGoogle | 76.1% | $0.069 |
| 41 | Ox Alpha MaxStealth | 75.8% | – |
| 42 | Qwen3.8 27BAlibaba · open weights | 75.7% | $0.094 |
| 43 | DeepSeek V4 Flash 0731DeepSeek · open weights | 75.0% | $0.060 |
| 44 | Qwen 3.7 MaxAlibaba | 74.2% | $0.18 |
| 45 | Kimi K2.7 CodeMoonshot AI · open weights | 74.0% | $0.10 |
| 46 | Qwen 3.8 MaxAlibaba · open weights | 72.9% | $0.28 |
| 47 | Qwen 3.8 Flash NextAlibaba · open weights | 72.6% | $0.042 |
| 48 | Gemini 3.8 Flash HighGoogle | 72.5% | $0.31 |
| 49 | Qwen 3.6 27BAlibaba · open weights | 71.8% | $0.20 |
| 50 | GPT-5.4 Mini xHighOpenAI | 71.6% | $0.33 |
| 51 | Inkling xHigh EffortThinking Machines · open weights | 71.0% | $0.31 |
| 52 | GPT-5.4 Nano xHighOpenAI | 70.8% | $0.091 |
| 53 | Nemotron 3 Ultra 550B A55BNVIDIA · open weights | 70.7% | $0.37 |
| 54 | Grok 4.3xAI | 69.9% | $0.061 |
| 55 | Grok 4.5xAI | 68.6% | $0.13 |
| 56 | DeepSeek V4 Flash Vision ExpDeepSeek · open weights | 68.2% | $0.051 |
| 57 | Minimax M3MiniMax | 68.2% | $0.060 |
| 58 | Grok Build 0.1xAI | 65.4% | $0.024 |
Need a model picked for your use case?
Benchmarks rank models on other people's tasks. For a business workflow I test the shortlist on your own data, costs and privacy requirements, and recommend one.