Skip to content

/ LLM benchmarks / Reasoning

Reasoning benchmarks

Logic, deduction and inference tasks from LiveBench, plus the LiveBench overall score.

DataLiveBenchrelease 2026-06-25fetched

LiveBench Reasoning leaderboard, 58 models
#ModelScoreCost/solved task
1
GPT-6 Astra Max EffortOpenAI
92.7%
$0.74
2
GPT-6.1 Sol Max EffortOpenAI
92.6%
$0.14
3
Claude 5.5 Opus Thinking Max EffortAnthropic
92.2%
$0.80
4
Claude Fable 5.1 Max EffortAnthropic
91.7%
$1.21
5
GPT-5.6 Sol Max EffortOpenAI
91.7%
$0.52
6
Claude 5 Opus Thinking Max EffortAnthropic
91.2%
$0.70
7
Kimi K3Moonshot AI · open weights
90.7%
$0.35
8
GPT-5.6 Terra Max EffortOpenAI
90.6%
$0.35
9
Grok 4.6 xHighxAI
90.5%
$0.21
10
Muse Spark 1.2 xHigh EffortMeta
90.0%
$0.38
11
Claude Fable 5 Max EffortAnthropic
89.7%
$1.44
12
Muse Spark 1.3 xHigh EffortMeta
89.7%
$0.22
13
GPT-5.5 Thinking xHigh EffortOpenAI
89.7%
$0.43
14
Gemini 3.8 Flash HighGoogle
89.3%
$0.31
15
Claude 4.8 Opus Thinking Max EffortAnthropic
89.2%
$0.98
16
GPT-6 Sol Max EffortOpenAI
88.7%
$0.27
17
Claude Sonnet 5 xHigh EffortAnthropic
88.7%
$0.51
18
Claude 4.6 Opus Thinking High EffortAnthropic
88.7%
$0.40
19
Qwen 3.8 MaxAlibaba · open weights
88.2%
$0.28
20
GPT-5.4 Thinking xHigh EffortOpenAI
88.1%
$0.39
21
Gemini 3.7 Flash HighGoogle
87.8%
$0.16
22
Muse Spark 1.1 xHigh EffortMeta
87.7%
$0.20
23
Qwen 3.8 Flash NextAlibaba · open weights
87.4%
$0.042
24
Claude 4.7 Opus Thinking xHigh EffortAnthropic
87.2%
$0.53
25
Grok 4.5xAI
87.2%
$0.13
26
Claude Sonnet 5.5 xHigh EffortAnthropic
86.8%
$0.14
27
DeepSeek V4.1 Flash Max EffortDeepSeek · open weights
86.7%
$0.029
28
DeepSeek V4 Flash 0731DeepSeek · open weights
86.6%
$0.060
29
DeepSeek V4 Pro 0813DeepSeek · open weights
85.8%
$0.044
30
GLM-5.3Z.AI · open weights
85.8%
$0.45
31
GPT-5.6 Luna Max EffortOpenAI
85.6%
$0.17
32
DeepSeek V4 Flash Vision ExpDeepSeek · open weights
85.4%
$0.051
33
Gemini 3.6 Flash HighGoogle
85.1%
$0.23
34
Claude 4.6 Sonnet Thinking Medium EffortAnthropic
84.8%
$0.31
35
Gemini 3.1 Pro Preview HighGoogle
84.0%
$0.29
36
Qwen 3.7 MaxAlibaba
83.3%
$0.18
37
GPT-5.2 HighOpenAI
83.2%
$0.23
38
Kimi K2.7 CodeMoonshot AI · open weights
82.8%
$0.10
39
Grok 4.7 xHighxAI
82.7%
$0.72
40
Gemini 3.5 Flash HighGoogle
82.0%
$0.25
41
GPT-6 Luna Max EffortOpenAI
81.8%
$0.026
42
GPT-5.4 Nano xHighOpenAI
81.1%
$0.091
43
Claude 4.5 Opus Thinking High EffortAnthropic
80.1%
$0.61
44
Qwen3.8 27BAlibaba · open weights
80.0%
$0.094
45
Kimi K2.6 ThinkingMoonshot AI · open weights
79.4%
$0.17
46
GLM-5.2Z.AI · open weights
78.6%
$0.23
47
Inkling xHigh EffortThinking Machines · open weights
78.3%
$0.31
48
GPT-5.2 CodexOpenAI
77.7%
$0.19
49
GLM-5.3 FlashZ.AI · open weights
77.6%
$0.031
50
Ox Alpha MaxStealth
76.6%
–
51
Grok Build 0.1xAI
76.4%
$0.024
52
Qwen 3.6 PlusAlibaba
75.8%
$0.23
53
Nemotron 3 Ultra 550B A55BNVIDIA · open weights
74.7%
$0.37
54
Minimax M3MiniMax
74.5%
$0.060
55
GPT-5.4 Mini xHighOpenAI
71.3%
$0.33
56
Grok 4.3xAI
70.8%
$0.061
57
Qwen 3.6 27BAlibaba · open weights
70.3%
$0.20
58
Gemini 3.5 Flash-Lite HighGoogle
60.2%
$0.069

Need a model picked for your use case?

Benchmarks rank models on other people's tasks. For a business workflow I test the shortlist on your own data, costs and privacy requirements, and recommend one.

AI consulting