/ LLM benchmarks / Reasoning
Reasoning benchmarks
Logic, deduction and inference tasks from LiveBench, plus the LiveBench overall score.
DataLiveBenchrelease 2026-06-25fetched
LiveBench Reasoning · CC BY-SA 4.0
View original source| # | Model | Score | Cost/solved task |
|---|---|---|---|
| 1 | GPT-6 Astra Max EffortOpenAI | 92.7% | $0.74 |
| 2 | GPT-6.1 Sol Max EffortOpenAI | 92.6% | $0.14 |
| 3 | Claude 5.5 Opus Thinking Max EffortAnthropic | 92.2% | $0.80 |
| 4 | Claude Fable 5.1 Max EffortAnthropic | 91.7% | $1.21 |
| 5 | GPT-5.6 Sol Max EffortOpenAI | 91.7% | $0.52 |
| 6 | Claude 5 Opus Thinking Max EffortAnthropic | 91.2% | $0.70 |
| 7 | Kimi K3Moonshot AI · open weights | 90.7% | $0.35 |
| 8 | GPT-5.6 Terra Max EffortOpenAI | 90.6% | $0.35 |
| 9 | Grok 4.6 xHighxAI | 90.5% | $0.21 |
| 10 | Muse Spark 1.2 xHigh EffortMeta | 90.0% | $0.38 |
| 11 | Claude Fable 5 Max EffortAnthropic | 89.7% | $1.44 |
| 12 | Muse Spark 1.3 xHigh EffortMeta | 89.7% | $0.22 |
| 13 | GPT-5.5 Thinking xHigh EffortOpenAI | 89.7% | $0.43 |
| 14 | Gemini 3.8 Flash HighGoogle | 89.3% | $0.31 |
| 15 | Claude 4.8 Opus Thinking Max EffortAnthropic | 89.2% | $0.98 |
| 16 | GPT-6 Sol Max EffortOpenAI | 88.7% | $0.27 |
| 17 | Claude Sonnet 5 xHigh EffortAnthropic | 88.7% | $0.51 |
| 18 | Claude 4.6 Opus Thinking High EffortAnthropic | 88.7% | $0.40 |
| 19 | Qwen 3.8 MaxAlibaba · open weights | 88.2% | $0.28 |
| 20 | GPT-5.4 Thinking xHigh EffortOpenAI | 88.1% | $0.39 |
| 21 | Gemini 3.7 Flash HighGoogle | 87.8% | $0.16 |
| 22 | Muse Spark 1.1 xHigh EffortMeta | 87.7% | $0.20 |
| 23 | Qwen 3.8 Flash NextAlibaba · open weights | 87.4% | $0.042 |
| 24 | Claude 4.7 Opus Thinking xHigh EffortAnthropic | 87.2% | $0.53 |
| 25 | Grok 4.5xAI | 87.2% | $0.13 |
| 26 | Claude Sonnet 5.5 xHigh EffortAnthropic | 86.8% | $0.14 |
| 27 | DeepSeek V4.1 Flash Max EffortDeepSeek · open weights | 86.7% | $0.029 |
| 28 | DeepSeek V4 Flash 0731DeepSeek · open weights | 86.6% | $0.060 |
| 29 | DeepSeek V4 Pro 0813DeepSeek · open weights | 85.8% | $0.044 |
| 30 | GLM-5.3Z.AI · open weights | 85.8% | $0.45 |
| 31 | GPT-5.6 Luna Max EffortOpenAI | 85.6% | $0.17 |
| 32 | DeepSeek V4 Flash Vision ExpDeepSeek · open weights | 85.4% | $0.051 |
| 33 | Gemini 3.6 Flash HighGoogle | 85.1% | $0.23 |
| 34 | Claude 4.6 Sonnet Thinking Medium EffortAnthropic | 84.8% | $0.31 |
| 35 | Gemini 3.1 Pro Preview HighGoogle | 84.0% | $0.29 |
| 36 | Qwen 3.7 MaxAlibaba | 83.3% | $0.18 |
| 37 | GPT-5.2 HighOpenAI | 83.2% | $0.23 |
| 38 | Kimi K2.7 CodeMoonshot AI · open weights | 82.8% | $0.10 |
| 39 | Grok 4.7 xHighxAI | 82.7% | $0.72 |
| 40 | Gemini 3.5 Flash HighGoogle | 82.0% | $0.25 |
| 41 | GPT-6 Luna Max EffortOpenAI | 81.8% | $0.026 |
| 42 | GPT-5.4 Nano xHighOpenAI | 81.1% | $0.091 |
| 43 | Claude 4.5 Opus Thinking High EffortAnthropic | 80.1% | $0.61 |
| 44 | Qwen3.8 27BAlibaba · open weights | 80.0% | $0.094 |
| 45 | Kimi K2.6 ThinkingMoonshot AI · open weights | 79.4% | $0.17 |
| 46 | GLM-5.2Z.AI · open weights | 78.6% | $0.23 |
| 47 | Inkling xHigh EffortThinking Machines · open weights | 78.3% | $0.31 |
| 48 | GPT-5.2 CodexOpenAI | 77.7% | $0.19 |
| 49 | GLM-5.3 FlashZ.AI · open weights | 77.6% | $0.031 |
| 50 | Ox Alpha MaxStealth | 76.6% | – |
| 51 | Grok Build 0.1xAI | 76.4% | $0.024 |
| 52 | Qwen 3.6 PlusAlibaba | 75.8% | $0.23 |
| 53 | Nemotron 3 Ultra 550B A55BNVIDIA · open weights | 74.7% | $0.37 |
| 54 | Minimax M3MiniMax | 74.5% | $0.060 |
| 55 | GPT-5.4 Mini xHighOpenAI | 71.3% | $0.33 |
| 56 | Grok 4.3xAI | 70.8% | $0.061 |
| 57 | Qwen 3.6 27BAlibaba · open weights | 70.3% | $0.20 |
| 58 | Gemini 3.5 Flash-Lite HighGoogle | 60.2% | $0.069 |
LiveBench Overall · CC BY-SA 4.0
View original source| # | Model | Score | Cost/solved task |
|---|---|---|---|
| 1 | Claude Fable 5.1 Max EffortAnthropic | 83.4% | $1.21 |
| 2 | Claude 5.5 Opus Thinking Max EffortAnthropic | 83.2% | $0.80 |
| 3 | Claude Fable 5 Max EffortAnthropic | 83.0% | $1.44 |
| 4 | GPT-6 Astra Max EffortOpenAI | 82.2% | $0.74 |
| 5 | GPT-6.1 Sol Max EffortOpenAI | 81.6% | $0.14 |
| 6 | Muse Spark 1.3 xHigh EffortMeta | 81.6% | $0.22 |
| 7 | DeepSeek V4.1 Flash Max EffortDeepSeek · open weights | 81.1% | $0.029 |
| 8 | GPT-5.6 Sol Max EffortOpenAI | 81.0% | $0.52 |
| 9 | GPT-5.5 Thinking xHigh EffortOpenAI | 80.2% | $0.43 |
| 10 | Claude 5 Opus Thinking Max EffortAnthropic | 80.1% | $0.70 |
| 11 | GPT-6 Sol Max EffortOpenAI | 79.3% | $0.27 |
| 12 | Kimi K3Moonshot AI · open weights | 79.2% | $0.35 |
| 13 | Gemini 3.7 Flash HighGoogle | 78.8% | $0.16 |
| 14 | Qwen 3.8 MaxAlibaba · open weights | 78.5% | $0.28 |
| 15 | Grok 4.6 xHighxAI | 78.0% | $0.21 |
| 16 | GPT-5.4 Thinking xHigh EffortOpenAI | 78.0% | $0.39 |
| 17 | Muse Spark 1.2 xHigh EffortMeta | 78.0% | $0.38 |
| 18 | GPT-5.6 Terra Max EffortOpenAI | 77.9% | $0.35 |
| 19 | Claude Sonnet 5.5 xHigh EffortAnthropic | 77.8% | $0.14 |
| 20 | DeepSeek V4 Pro 0813DeepSeek · open weights | 77.4% | $0.044 |
| 21 | Grok 4.7 xHighxAI | 77.4% | $0.72 |
| 22 | Gemini 3.1 Pro Preview HighGoogle | 77.0% | $0.29 |
| 23 | DeepSeek V4 Flash Vision ExpDeepSeek · open weights | 76.8% | $0.051 |
| 24 | Claude 4.7 Opus Thinking xHigh EffortAnthropic | 76.5% | $0.53 |
| 25 | Claude 4.8 Opus Thinking Max EffortAnthropic | 76.2% | $0.98 |
| 26 | Qwen 3.8 Flash NextAlibaba · open weights | 76.2% | $0.042 |
| 27 | GLM-5.3Z.AI · open weights | 76.1% | $0.45 |
| 28 | Claude Sonnet 5 xHigh EffortAnthropic | 76.0% | $0.51 |
| 29 | Gemini 3.8 Flash HighGoogle | 75.8% | $0.31 |
| 30 | Grok 4.5xAI | 75.8% | $0.13 |
| 31 | Muse Spark 1.1 xHigh EffortMeta | 75.3% | $0.20 |
| 32 | Qwen3.8 27BAlibaba · open weights | 75.3% | $0.094 |
| 33 | Gemini 3.5 Flash HighGoogle | 74.6% | $0.25 |
| 34 | GPT-5.2 HighOpenAI | 74.6% | $0.23 |
| 35 | Claude 4.6 Opus Thinking High EffortAnthropic | 74.5% | $0.40 |
| 36 | DeepSeek V4 Flash 0731DeepSeek · open weights | 74.2% | $0.060 |
| 37 | GPT-5.2 CodexOpenAI | 74.0% | $0.19 |
| 38 | Gemini 3.6 Flash HighGoogle | 73.6% | $0.23 |
| 39 | GPT-5.6 Luna Max EffortOpenAI | 73.6% | $0.17 |
| 40 | GLM-5.2Z.AI · open weights | 73.2% | $0.23 |
| 41 | Qwen 3.7 MaxAlibaba | 73.1% | $0.18 |
| 42 | Claude 4.6 Sonnet Thinking Medium EffortAnthropic | 73.0% | $0.31 |
| 43 | Claude 4.5 Opus Thinking High EffortAnthropic | 72.6% | $0.61 |
| 44 | GPT-6 Luna Max EffortOpenAI | 72.0% | $0.026 |
| 45 | Inkling xHigh EffortThinking Machines · open weights | 71.9% | $0.31 |
| 46 | GLM-5.3 FlashZ.AI · open weights | 71.6% | $0.031 |
| 47 | Kimi K2.6 ThinkingMoonshot AI · open weights | 70.5% | $0.17 |
| 48 | GPT-5.4 Nano xHighOpenAI | 69.6% | $0.091 |
| 49 | Ox Alpha MaxStealth | 69.2% | – |
| 50 | Qwen 3.6 PlusAlibaba | 68.9% | $0.23 |
| 51 | Kimi K2.7 CodeMoonshot AI · open weights | 68.4% | $0.10 |
| 52 | Grok Build 0.1xAI | 67.8% | $0.024 |
| 53 | Nemotron 3 Ultra 550B A55BNVIDIA · open weights | 67.4% | $0.37 |
| 54 | Minimax M3MiniMax | 67.3% | $0.060 |
| 55 | GPT-5.4 Mini xHighOpenAI | 66.4% | $0.33 |
| 56 | Qwen 3.6 27BAlibaba · open weights | 64.0% | $0.20 |
| 57 | Gemini 3.5 Flash-Lite HighGoogle | 63.9% | $0.069 |
| 58 | Grok 4.3xAI | 62.3% | $0.061 |
Need a model picked for your use case?
Benchmarks rank models on other people's tasks. For a business workflow I test the shortlist on your own data, costs and privacy requirements, and recommend one.