/ LLM-Benchmarks / Coding
Beste KI zum Programmieren: das Live-Ranking
Code-Generierung und Webentwicklung aus Code Arena (Elo) und LiveBench.
DatenCode Arena01.10.2026LiveBenchRelease 2026-06-25abgerufen
Code Arena
Originalquelle ansehen| # | Modell | Wertung |
|---|---|---|
| 1 | Claude Opus 5.5 MaxAnthropic | 1815Elo +16/-16 |
| 2 | GPT-6 Astra MaxOpenAI | 1788Elo +10/-10 |
| 3 | Claude Sonnet 5.5 xHighAnthropic | 1786Elo +18/-18 |
| 4 | GPT-6.1 Sol MaxOpenAI | 1758Elo +17/-17 |
| 5 | Claude Fable 5.1 MaxAnthropic | 1749Elo +10/-10 |
| 6 | Claude Sonnet 5.5 HighAnthropic | 1715Elo +13/-13 |
| 7 | Claude Opus 5 MaxAnthropic | 1695Elo +6/-6 |
| 8 | GPT-6 Sol MaxOpenAI | 1689Elo +11/-11 |
| 9 | Gemini 4 Argon HighGoogle | 1680Elo +13/-13 |
| 10 | Qwen 3.8 MaxAlibaba | 1671Elo +12/-12 |
| 11 | Qwen 3.8 Max 0902Alibaba | 1670Elo +8/-8 |
| 12 | Claude Opus 5 HighAnthropic | 1660Elo +6/-6 |
| 13 | Kimi K3 MaxMoonshot AI | 1658Elo +6/-6 |
| 14 | 1657Elo +9/-9 | |
| 15 | Grok 4.7 xHighSpaceXAI | 1638Elo +12/-12 |
| 16 | Qwen 3.8 Flash NextAlibaba | 1637Elo +9/-9 |
| 17 | Hy4 PreviewTencent | 1633Elo +9/-9 |
| 18 | Claude Fable 5 HighAnthropic | 1625Elo +6/-6 |
| 19 | 1624Elo +9/-9 | |
| 20 | GLM-5.3 MaxZ.AI | 1623Elo +8/-8 |
| 21 | DeepSeek V4.1 Flash MaxDeepSeek | 1620Elo +10/-10 |
| 22 | 1620Elo +6/-6 | |
| 23 | Grok 4.6 HighSpaceXAI | 1620Elo +8/-8 |
| 24 | MiMo V2.6 ProXiaomi | 1618Elo +12/-12 |
| 25 | GLM-5.3 FlashZ.AI | 1616Elo +8/-8 |
| 26 | GLM-5.2 MaxZ.AI | 1605Elo +6/-6 |
| 27 | Gemini 3.7 Flash HighGoogle | 1592Elo +7/-7 |
| 28 | Qwen 3.8 27BAlibaba | 1591Elo +7/-7 |
| 29 | Gemini 3.8 Flash HighGoogle | 1583Elo +8/-8 |
| 30 | DeepSeek V4 Pro High 20260813DeepSeek | 1583Elo +9/-9 |
| 31 | DeepSeek V4 Flash HighDeepSeek | 1581Elo +9/-9 |
| 32 | GPT-6 Luna MaxOpenAI | 1579Elo +9/-9 |
| 33 | Step 5 Preview HighStepfun | 1570Elo +13/-13 |
| 34 | Claude Opus 4.7 HighAnthropic | 1557Elo +6/-6 |
| 35 | Claude Opus 4.8 HighAnthropic | 1556Elo +6/-6 |
| 36 | Claude Opus 4.7Anthropic | 1555Elo +6/-6 |
| 37 | Grok 4.5SpaceXAI | 1552Elo +7/-7 |
| 38 | Claude Opus 4.6 HighAnthropic | 1546Elo +5/-5 |
| 39 | Muse Spark 1.1Meta | 1542Elo +8/-8 |
| 40 | Claude Sonnet 5 HighAnthropic | 1539Elo +6/-6 |
| 41 | Claude Opus 4.6Anthropic | 1537Elo +5/-5 |
| 42 | Gemini 3.6 Flash HighGoogle | 1536Elo +7/-7 |
| 43 | Claude Opus 4.8Anthropic | 1534Elo +6/-6 |
| 44 | 1532Elo +14/-14 | |
| 45 | Claude Sonnet 4.6Anthropic | 1521Elo +5/-5 |
| 46 | 1519Elo +7/-7 | |
| 47 | 1518Elo +6/-6 | |
| 48 | Seed 2.1 Pro PreviewBytedance | 1517Elo +6/-6 |
| 49 | Qwen 3.7 Max 20260517Alibaba | 1515Elo +7/-7 |
| 50 | 1512Elo +6/-6 | |
| 51 | Kimi K2.6Moonshot AI | 1509Elo +7/-7 |
| 52 | GLM-5.1Z.AI | 1508Elo +7/-7 |
| 53 | Hy3Tencent | 1507Elo +9/-9 |
| 54 | Gemini 3.5 Flash HighGoogle | 1499Elo +7/-7 |
| 55 | Claude Opus 4.5 20251101 High 32KAnthropic | 1493Elo +8/-8 |
| 56 | Gemini 3.5 Flash MediumGoogle | 1490Elo +7/-7 |
| 57 | 1487Elo +6/-6 | |
| 58 | MiniMax M3MiniMax | 1482Elo +6/-6 |
| 59 | Qwen 3.6 Max PreviewAlibaba | 1482Elo +13/-13 |
| 60 | MiMo V2.5 ProXiaomi | 1478Elo +5/-5 |
| 61 | Kimi K2.7 CodeMoonshot AI | 1473Elo +9/-9 |
| 62 | Claude Opus 4.5 20251101Anthropic | 1468Elo +7/-7 |
| 63 | 1465Elo +19/-19 | |
| 64 | DeepSeek V4 Pro High PreviewDeepSeek | 1463Elo +6/-6 |
| 65 | Qwen 3.6 PlusAlibaba | 1461Elo +6/-6 |
| 66 | GPT-5.5 (codex-harness)OpenAI | 1456Elo +6/-6 |
| 67 | Gemini 3.1 Pro PreviewGoogle | 1446Elo +5/-5 |
| 68 | DeepSeek V4 ProDeepSeek | 1446Elo +6/-6 |
| 69 | 1444Elo +18/-18 | |
| 70 | Gemini 3.5 Flash LiteGoogle | 1440Elo +41/-41 |
| 71 | Gemini 3 ProGoogle | 1439Elo +8/-8 |
| 72 | Gemini 3 FlashGoogle | 1439Elo +9/-9 |
| 73 | MiMo V2.5Xiaomi | 1438Elo +6/-6 |
| 74 | Kimi K2.5 ThinkingMoonshot AI | 1436Elo +5/-5 |
| 75 | GLM-4.7Z.AI | 1434Elo +12/-12 |
| 76 | GLM-5Z.AI | 1434Elo +8/-8 |
| 77 | MiMo V2 ProXiaomi | 1433Elo +8/-8 |
| 78 | DeepSeek V4 Flash High PreviewDeepSeek | 1430Elo +7/-7 |
| 79 | GPT-5 MediumOpenAI | 1417Elo +16/-16 |
| 80 | GPT-5.2OpenAI | 1415Elo +22/-22 |
| 81 | InklingThinking Machines | 1413Elo +6/-6 |
| 82 | Inkling SmallThinking Machines | 1408Elo +9/-9 |
| 83 | 1408Elo +14/-14 | |
| 84 | Kimi K2.5 InstantMoonshot AI | 1404Elo +12/-12 |
| 85 | GLM-5v TurboZ.AI | 1400Elo +13/-13 |
| 86 | Qwen 3.5 397B A17BAlibaba | 1399Elo +5/-5 |
| 87 | GPT-5.4 Mini HighOpenAI | 1397Elo +7/-7 |
| 88 | MiniMax M2.7MiniMax | 1397Elo +6/-6 |
| 89 | GPT-5.4OpenAI | 1395Elo +11/-11 |
| 90 | GPT-5.1 MediumOpenAI | 1395Elo +11/-11 |
| 91 | Claude Sonnet 4.5 20250929 High 32KAnthropic | 1393Elo +8/-8 |
| 92 | Claude Opus 4.1 20250805Anthropic | 1389Elo +11/-11 |
| 93 | MiniMax M2.5MiniMax | 1386Elo +8/-8 |
| 94 | Claude Sonnet 4.5 20250929Anthropic | 1384Elo +7/-7 |
| 95 | 1384Elo +5/-5 | |
| 96 | MiniMax M2.1 PreviewMiniMax | 1384Elo +10/-10 |
| 97 | Grok 4.20 Beta 0309 ReasoningSpaceXAI | 1374Elo +6/-6 |
| 98 | 1371Elo +11/-11 | |
| 99 | Solar Pro4Upstage | 1370Elo +10/-10 |
| 100 | Gemma 4 31BGoogle | 1365Elo +6/-6 |
| 101 | DeepSeek V3.2 ThinkingDeepSeek | 1362Elo +9/-9 |
| 102 | Qwen 3.5 122B A10BAlibaba | 1360Elo +8/-8 |
| 103 | Gemma 4 26B A4BGoogle | 1358Elo +17/-17 |
| 104 | Qwen 3.5 27BAlibaba | 1357Elo +8/-8 |
| 105 | Grok 4.3SpaceXAI | 1357Elo +6/-6 |
| 106 | Hunyuan Hy3 PreviewTencent | 1356Elo +17/-17 |
| 107 | Muse GlimmerMeta | 1355Elo +16/-16 |
| 108 | Laguna M.1Poolside | 1348Elo +9/-9 |
| 109 | GPT-5.1OpenAI | 1341Elo +8/-8 |
| 110 | GLM-4.6Z.AI | 1339Elo +11/-11 |
| 111 | GPT-5.2 CodexOpenAI | 1339Elo +9/-9 |
| 112 | GPT-5.1 CodexOpenAI | 1337Elo +12/-12 |
| 113 | 1330Elo +10/-10 | |
| 114 | Claude Haiku 4.5 20251001Anthropic | 1329Elo +5/-5 |
| 115 | DeepSeek V3.2DeepSeek | 1325Elo +8/-8 |
| 116 | Kimi K2 Thinking TurboMoonshot AI | 1321Elo +7/-7 |
| 117 | Laguna Xs.2Poolside | 1302Elo +11/-11 |
| 118 | MiniMax M2MiniMax | 1297Elo +11/-11 |
| 119 | MiMo V2 Flash (thinking)Xiaomi | 1292Elo +16/-16 |
| 120 | 1274Elo +8/-8 | |
| 121 | DeepSeek V3.2 ExpDeepSeek | 1272Elo +13/-13 |
| 122 | Mistral Medium 3.5Mistral | 1263Elo +15/-15 |
| 123 | 1256Elo +7/-7 | |
| 124 | KAT Coder Pro V1Unknown | 1255Elo +19/-19 |
| 125 | Qwen 3.5 35B A3BAlibaba | 1253Elo +17/-17 |
| 126 | GPT-5.1 Codex MiniOpenAI | 1244Elo +22/-22 |
| 127 | Qwen 3.5 FlashAlibaba | 1243Elo +20/-20 |
| 128 | Grok 4.1 Fast ReasoningSpaceXAI | 1241Elo +11/-11 |
| 129 | Trinity Large ThinkingArcee AI | 1238Elo +20/-20 |
| 130 | Mistral Large 3Mistral | 1230Elo +25/-25 |
| 131 | Gemini 2.5 ProGoogle | 1227Elo +16/-16 |
| 132 | Grok 4.1 ThinkingSpaceXAI | 1214Elo +25/-25 |
| 133 | Devstral 2Mistral | 1196Elo +21/-21 |
| 134 | 1190Elo +18/-18 | |
| 135 | Mercury 2Inception AI | 1170Elo +24/-24 |
| 136 | Grok Code Fast 1SpaceXAI | 1167Elo +28/-28 |
| 137 | Grok 4 Fast ReasoningSpaceXAI | 1159Elo +27/-27 |
| 138 | Devstral Medium 2507Mistral | 1076Elo +31/-31 |
LiveBench Coding · CC BY-SA 4.0
Originalquelle ansehen| # | Modell | Wertung | Kosten pro gelöster Aufgabe |
|---|---|---|---|
| 1 | Claude 5.5 Opus Thinking Max EffortAnthropic | 89.3% | $0.80 |
| 2 | Claude Sonnet 5.5 xHigh EffortAnthropic | 88.9% | $0.14 |
| 3 | Claude Fable 5.1 Max EffortAnthropic | 86.4% | $1.21 |
| 4 | Claude Fable 5 Max EffortAnthropic | 86.0% | $1.44 |
| 5 | GPT-5.6 Sol Max EffortOpenAI | 83.9% | $0.52 |
| 6 | GPT-5.2 CodexOpenAI | 83.6% | $0.19 |
| 7 | GPT-5.6 Luna Max EffortOpenAI | 82.9% | $0.17 |
| 8 | GPT-5.5 Thinking xHigh EffortOpenAI | 82.1% | $0.43 |
| 9 | Claude 4.7 Opus Thinking xHigh EffortAnthropic | 82.1% | $0.53 |
| 10 | GPT-6 Sol Max EffortOpenAI | 81.8% | $0.27 |
| 11 | Claude 4.8 Opus Thinking Max EffortAnthropic | 81.8% | $0.98 |
| 12 | Claude 5 Opus Thinking Max EffortAnthropic | 81.4% | $0.70 |
| 13 | Kimi K3Moonshot AI · Open Weights | 81.4% | $0.35 |
| 14 | Muse Spark 1.3 xHigh EffortMeta | 81.1% | $0.22 |
| 15 | Claude Sonnet 5 xHigh EffortAnthropic | 80.7% | $0.51 |
| 16 | GPT-6 Astra Max EffortOpenAI | 80.4% | $0.74 |
| 17 | GPT-6.1 Sol Max EffortOpenAI | 80.4% | $0.14 |
| 18 | DeepSeek V4.1 Flash Max EffortDeepSeek · Open Weights | 80.0% | $0.029 |
| 19 | GLM-5.2Z.AI · Open Weights | 79.7% | $0.23 |
| 20 | Claude 4.5 Opus Thinking High EffortAnthropic | 79.7% | $0.61 |
| 21 | Claude 4.6 Sonnet Thinking Medium EffortAnthropic | 79.3% | $0.31 |
| 22 | GLM-5.3Z.AI · Open Weights | 79.0% | $0.45 |
| 23 | GPT-6 Luna Max EffortOpenAI | 79.0% | $0.026 |
| 24 | GLM-5.3 FlashZ.AI · Open Weights | 79.0% | $0.031 |
| 25 | Gemini 3.7 Flash HighGoogle | 78.9% | $0.16 |
| 26 | Kimi K2.6 ThinkingMoonshot AI · Open Weights | 78.6% | $0.17 |
| 27 | GPT-5.6 Terra Max EffortOpenAI | 78.2% | $0.35 |
| 28 | Gemini 3.5 Flash HighGoogle | 78.2% | $0.25 |
| 29 | Claude 4.6 Opus Thinking High EffortAnthropic | 78.2% | $0.40 |
| 30 | Qwen 3.6 PlusAlibaba | 78.2% | $0.23 |
| 31 | Gemini 3.6 Flash HighGoogle | 77.9% | $0.23 |
| 32 | GPT-5.4 Thinking xHigh EffortOpenAI | 77.5% | $0.39 |
| 33 | Muse Spark 1.2 xHigh EffortMeta | 77.5% | $0.38 |
| 34 | DeepSeek V4 Pro 0813DeepSeek · Open Weights | 77.2% | $0.044 |
| 35 | Grok 4.7 xHighxAI | 77.2% | $0.72 |
| 36 | Muse Spark 1.1 xHigh EffortMeta | 77.2% | $0.20 |
| 37 | Grok 4.6 xHighxAI | 76.8% | $0.21 |
| 38 | Gemini 3.1 Pro Preview HighGoogle | 76.5% | $0.29 |
| 39 | GPT-5.2 HighOpenAI | 76.1% | $0.23 |
| 40 | Gemini 3.5 Flash-Lite HighGoogle | 76.1% | $0.069 |
| 41 | Ox Alpha MaxStealth | 75.8% | – |
| 42 | Qwen3.8 27BAlibaba · Open Weights | 75.7% | $0.094 |
| 43 | DeepSeek V4 Flash 0731DeepSeek · Open Weights | 75.0% | $0.060 |
| 44 | Qwen 3.7 MaxAlibaba | 74.2% | $0.18 |
| 45 | Kimi K2.7 CodeMoonshot AI · Open Weights | 74.0% | $0.10 |
| 46 | Qwen 3.8 MaxAlibaba · Open Weights | 72.9% | $0.28 |
| 47 | Qwen 3.8 Flash NextAlibaba · Open Weights | 72.6% | $0.042 |
| 48 | Gemini 3.8 Flash HighGoogle | 72.5% | $0.31 |
| 49 | Qwen 3.6 27BAlibaba · Open Weights | 71.8% | $0.20 |
| 50 | GPT-5.4 Mini xHighOpenAI | 71.6% | $0.33 |
| 51 | Inkling xHigh EffortThinking Machines · Open Weights | 71.0% | $0.31 |
| 52 | GPT-5.4 Nano xHighOpenAI | 70.8% | $0.091 |
| 53 | Nemotron 3 Ultra 550B A55BNVIDIA · Open Weights | 70.7% | $0.37 |
| 54 | Grok 4.3xAI | 69.9% | $0.061 |
| 55 | Grok 4.5xAI | 68.6% | $0.13 |
| 56 | DeepSeek V4 Flash Vision ExpDeepSeek · Open Weights | 68.2% | $0.051 |
| 57 | Minimax M3MiniMax | 68.2% | $0.060 |
| 58 | Grok Build 0.1xAI | 65.4% | $0.024 |
Sie brauchen ein Modell für Ihren konkreten Fall?
Benchmarks bewerten Modelle anhand fremder Aufgaben. Für einen Geschäftsprozess teste ich die engere Wahl mit Ihren eigenen Daten, Kosten und Datenschutzvorgaben und empfehle eines.