/ LLM-Benchmarks / Reasoning
Reasoning-Modell im Vergleich: wer am besten schlussfolgert
Logik, Deduktion und Schlussfolgerung aus LiveBench, dazu der LiveBench-Gesamtwert.
DatenLiveBenchRelease 2026-06-25abgerufen
LiveBench Reasoning · CC BY-SA 4.0
Originalquelle ansehen| # | Modell | Wertung | Kosten pro gelöster Aufgabe |
|---|---|---|---|
| 1 | GPT-6 Astra Max EffortOpenAI | 92.7% | $0.74 |
| 2 | GPT-6.1 Sol Max EffortOpenAI | 92.6% | $0.14 |
| 3 | Claude 5.5 Opus Thinking Max EffortAnthropic | 92.2% | $0.80 |
| 4 | Claude Fable 5.1 Max EffortAnthropic | 91.7% | $1.21 |
| 5 | GPT-5.6 Sol Max EffortOpenAI | 91.7% | $0.52 |
| 6 | Claude 5 Opus Thinking Max EffortAnthropic | 91.2% | $0.70 |
| 7 | Kimi K3Moonshot AI · Open Weights | 90.7% | $0.35 |
| 8 | GPT-5.6 Terra Max EffortOpenAI | 90.6% | $0.35 |
| 9 | Grok 4.6 xHighxAI | 90.5% | $0.21 |
| 10 | Muse Spark 1.2 xHigh EffortMeta | 90.0% | $0.38 |
| 11 | Claude Fable 5 Max EffortAnthropic | 89.7% | $1.44 |
| 12 | Muse Spark 1.3 xHigh EffortMeta | 89.7% | $0.22 |
| 13 | GPT-5.5 Thinking xHigh EffortOpenAI | 89.7% | $0.43 |
| 14 | Gemini 3.8 Flash HighGoogle | 89.3% | $0.31 |
| 15 | Claude 4.8 Opus Thinking Max EffortAnthropic | 89.2% | $0.98 |
| 16 | GPT-6 Sol Max EffortOpenAI | 88.7% | $0.27 |
| 17 | Claude Sonnet 5 xHigh EffortAnthropic | 88.7% | $0.51 |
| 18 | Claude 4.6 Opus Thinking High EffortAnthropic | 88.7% | $0.40 |
| 19 | Qwen 3.8 MaxAlibaba · Open Weights | 88.2% | $0.28 |
| 20 | GPT-5.4 Thinking xHigh EffortOpenAI | 88.1% | $0.39 |
| 21 | Gemini 3.7 Flash HighGoogle | 87.8% | $0.16 |
| 22 | Muse Spark 1.1 xHigh EffortMeta | 87.7% | $0.20 |
| 23 | Qwen 3.8 Flash NextAlibaba · Open Weights | 87.4% | $0.042 |
| 24 | Claude 4.7 Opus Thinking xHigh EffortAnthropic | 87.2% | $0.53 |
| 25 | Grok 4.5xAI | 87.2% | $0.13 |
| 26 | Claude Sonnet 5.5 xHigh EffortAnthropic | 86.8% | $0.14 |
| 27 | DeepSeek V4.1 Flash Max EffortDeepSeek · Open Weights | 86.7% | $0.029 |
| 28 | DeepSeek V4 Flash 0731DeepSeek · Open Weights | 86.6% | $0.060 |
| 29 | DeepSeek V4 Pro 0813DeepSeek · Open Weights | 85.8% | $0.044 |
| 30 | GLM-5.3Z.AI · Open Weights | 85.8% | $0.45 |
| 31 | GPT-5.6 Luna Max EffortOpenAI | 85.6% | $0.17 |
| 32 | DeepSeek V4 Flash Vision ExpDeepSeek · Open Weights | 85.4% | $0.051 |
| 33 | Gemini 3.6 Flash HighGoogle | 85.1% | $0.23 |
| 34 | Claude 4.6 Sonnet Thinking Medium EffortAnthropic | 84.8% | $0.31 |
| 35 | Gemini 3.1 Pro Preview HighGoogle | 84.0% | $0.29 |
| 36 | Qwen 3.7 MaxAlibaba | 83.3% | $0.18 |
| 37 | GPT-5.2 HighOpenAI | 83.2% | $0.23 |
| 38 | Kimi K2.7 CodeMoonshot AI · Open Weights | 82.8% | $0.10 |
| 39 | Grok 4.7 xHighxAI | 82.7% | $0.72 |
| 40 | Gemini 3.5 Flash HighGoogle | 82.0% | $0.25 |
| 41 | GPT-6 Luna Max EffortOpenAI | 81.8% | $0.026 |
| 42 | GPT-5.4 Nano xHighOpenAI | 81.1% | $0.091 |
| 43 | Claude 4.5 Opus Thinking High EffortAnthropic | 80.1% | $0.61 |
| 44 | Qwen3.8 27BAlibaba · Open Weights | 80.0% | $0.094 |
| 45 | Kimi K2.6 ThinkingMoonshot AI · Open Weights | 79.4% | $0.17 |
| 46 | GLM-5.2Z.AI · Open Weights | 78.6% | $0.23 |
| 47 | Inkling xHigh EffortThinking Machines · Open Weights | 78.3% | $0.31 |
| 48 | GPT-5.2 CodexOpenAI | 77.7% | $0.19 |
| 49 | GLM-5.3 FlashZ.AI · Open Weights | 77.6% | $0.031 |
| 50 | Ox Alpha MaxStealth | 76.6% | – |
| 51 | Grok Build 0.1xAI | 76.4% | $0.024 |
| 52 | Qwen 3.6 PlusAlibaba | 75.8% | $0.23 |
| 53 | Nemotron 3 Ultra 550B A55BNVIDIA · Open Weights | 74.7% | $0.37 |
| 54 | Minimax M3MiniMax | 74.5% | $0.060 |
| 55 | GPT-5.4 Mini xHighOpenAI | 71.3% | $0.33 |
| 56 | Grok 4.3xAI | 70.8% | $0.061 |
| 57 | Qwen 3.6 27BAlibaba · Open Weights | 70.3% | $0.20 |
| 58 | Gemini 3.5 Flash-Lite HighGoogle | 60.2% | $0.069 |
LiveBench Overall · CC BY-SA 4.0
Originalquelle ansehen| # | Modell | Wertung | Kosten pro gelöster Aufgabe |
|---|---|---|---|
| 1 | Claude Fable 5.1 Max EffortAnthropic | 83.4% | $1.21 |
| 2 | Claude 5.5 Opus Thinking Max EffortAnthropic | 83.2% | $0.80 |
| 3 | Claude Fable 5 Max EffortAnthropic | 83.0% | $1.44 |
| 4 | GPT-6 Astra Max EffortOpenAI | 82.2% | $0.74 |
| 5 | GPT-6.1 Sol Max EffortOpenAI | 81.6% | $0.14 |
| 6 | Muse Spark 1.3 xHigh EffortMeta | 81.6% | $0.22 |
| 7 | DeepSeek V4.1 Flash Max EffortDeepSeek · Open Weights | 81.1% | $0.029 |
| 8 | GPT-5.6 Sol Max EffortOpenAI | 81.0% | $0.52 |
| 9 | GPT-5.5 Thinking xHigh EffortOpenAI | 80.2% | $0.43 |
| 10 | Claude 5 Opus Thinking Max EffortAnthropic | 80.1% | $0.70 |
| 11 | GPT-6 Sol Max EffortOpenAI | 79.3% | $0.27 |
| 12 | Kimi K3Moonshot AI · Open Weights | 79.2% | $0.35 |
| 13 | Gemini 3.7 Flash HighGoogle | 78.8% | $0.16 |
| 14 | Qwen 3.8 MaxAlibaba · Open Weights | 78.5% | $0.28 |
| 15 | Grok 4.6 xHighxAI | 78.0% | $0.21 |
| 16 | GPT-5.4 Thinking xHigh EffortOpenAI | 78.0% | $0.39 |
| 17 | Muse Spark 1.2 xHigh EffortMeta | 78.0% | $0.38 |
| 18 | GPT-5.6 Terra Max EffortOpenAI | 77.9% | $0.35 |
| 19 | Claude Sonnet 5.5 xHigh EffortAnthropic | 77.8% | $0.14 |
| 20 | DeepSeek V4 Pro 0813DeepSeek · Open Weights | 77.4% | $0.044 |
| 21 | Grok 4.7 xHighxAI | 77.4% | $0.72 |
| 22 | Gemini 3.1 Pro Preview HighGoogle | 77.0% | $0.29 |
| 23 | DeepSeek V4 Flash Vision ExpDeepSeek · Open Weights | 76.8% | $0.051 |
| 24 | Claude 4.7 Opus Thinking xHigh EffortAnthropic | 76.5% | $0.53 |
| 25 | Claude 4.8 Opus Thinking Max EffortAnthropic | 76.2% | $0.98 |
| 26 | Qwen 3.8 Flash NextAlibaba · Open Weights | 76.2% | $0.042 |
| 27 | GLM-5.3Z.AI · Open Weights | 76.1% | $0.45 |
| 28 | Claude Sonnet 5 xHigh EffortAnthropic | 76.0% | $0.51 |
| 29 | Gemini 3.8 Flash HighGoogle | 75.8% | $0.31 |
| 30 | Grok 4.5xAI | 75.8% | $0.13 |
| 31 | Muse Spark 1.1 xHigh EffortMeta | 75.3% | $0.20 |
| 32 | Qwen3.8 27BAlibaba · Open Weights | 75.3% | $0.094 |
| 33 | Gemini 3.5 Flash HighGoogle | 74.6% | $0.25 |
| 34 | GPT-5.2 HighOpenAI | 74.6% | $0.23 |
| 35 | Claude 4.6 Opus Thinking High EffortAnthropic | 74.5% | $0.40 |
| 36 | DeepSeek V4 Flash 0731DeepSeek · Open Weights | 74.2% | $0.060 |
| 37 | GPT-5.2 CodexOpenAI | 74.0% | $0.19 |
| 38 | Gemini 3.6 Flash HighGoogle | 73.6% | $0.23 |
| 39 | GPT-5.6 Luna Max EffortOpenAI | 73.6% | $0.17 |
| 40 | GLM-5.2Z.AI · Open Weights | 73.2% | $0.23 |
| 41 | Qwen 3.7 MaxAlibaba | 73.1% | $0.18 |
| 42 | Claude 4.6 Sonnet Thinking Medium EffortAnthropic | 73.0% | $0.31 |
| 43 | Claude 4.5 Opus Thinking High EffortAnthropic | 72.6% | $0.61 |
| 44 | GPT-6 Luna Max EffortOpenAI | 72.0% | $0.026 |
| 45 | Inkling xHigh EffortThinking Machines · Open Weights | 71.9% | $0.31 |
| 46 | GLM-5.3 FlashZ.AI · Open Weights | 71.6% | $0.031 |
| 47 | Kimi K2.6 ThinkingMoonshot AI · Open Weights | 70.5% | $0.17 |
| 48 | GPT-5.4 Nano xHighOpenAI | 69.6% | $0.091 |
| 49 | Ox Alpha MaxStealth | 69.2% | – |
| 50 | Qwen 3.6 PlusAlibaba | 68.9% | $0.23 |
| 51 | Kimi K2.7 CodeMoonshot AI · Open Weights | 68.4% | $0.10 |
| 52 | Grok Build 0.1xAI | 67.8% | $0.024 |
| 53 | Nemotron 3 Ultra 550B A55BNVIDIA · Open Weights | 67.4% | $0.37 |
| 54 | Minimax M3MiniMax | 67.3% | $0.060 |
| 55 | GPT-5.4 Mini xHighOpenAI | 66.4% | $0.33 |
| 56 | Qwen 3.6 27BAlibaba · Open Weights | 64.0% | $0.20 |
| 57 | Gemini 3.5 Flash-Lite HighGoogle | 63.9% | $0.069 |
| 58 | Grok 4.3xAI | 62.3% | $0.061 |
Sie brauchen ein Modell für Ihren konkreten Fall?
Benchmarks bewerten Modelle anhand fremder Aufgaben. Für einen Geschäftsprozess teste ich die engere Wahl mit Ihren eigenen Daten, Kosten und Datenschutzvorgaben und empfehle eines.