Skip to content

/ LLM benchmarks / Data Analysis

Data analysis benchmarks

Structured data interpretation, querying and analysis from LiveBench.

DataLiveBenchrelease 2026-06-25fetched

LiveBench Data Analysis · CC BY-SA 4.0

View original source
LiveBench Data Analysis leaderboard, 58 models
#ModelScoreCost/solved task
1
GPT-6 Astra Max EffortOpenAI
83.0%
$0.74
2
GPT-6.1 Sol Max EffortOpenAI
82.7%
$0.14
3
GPT-5.5 Thinking xHigh EffortOpenAI
81.6%
$0.43
4
GPT-6 Sol Max EffortOpenAI
81.2%
$0.27
5
Claude Fable 5 Max EffortAnthropic
80.5%
$1.44
6
Claude Fable 5.1 Max EffortAnthropic
80.3%
$1.21
7
Claude 5.5 Opus Thinking Max EffortAnthropic
80.3%
$0.80
8
GPT-5.6 Sol Max EffortOpenAI
79.8%
$0.52
9
Muse Spark 1.3 xHigh EffortMeta
79.6%
$0.22
10
DeepSeek V4 Flash Vision ExpDeepSeek · open weights
79.5%
$0.051
11
DeepSeek V4.1 Flash Max EffortDeepSeek · open weights
79.3%
$0.029
12
GPT-5.4 Thinking xHigh EffortOpenAI
79.3%
$0.39
13
GPT-5.6 Terra Max EffortOpenAI
79.3%
$0.35
14
DeepSeek V4 Flash 0731DeepSeek · open weights
79.3%
$0.060
15
DeepSeek V4 Pro 0813DeepSeek · open weights
79.2%
$0.044
16
Kimi K3Moonshot AI · open weights
78.7%
$0.35
17
Claude Sonnet 5.5 xHigh EffortAnthropic
78.6%
$0.14
18
Gemini 3.1 Pro Preview HighGoogle
78.5%
$0.29
19
Qwen 3.8 MaxAlibaba · open weights
78.4%
$0.28
20
Claude 4.7 Opus Thinking xHigh EffortAnthropic
78.3%
$0.53
21
GPT-5.2 HighOpenAI
78.2%
$0.23
22
GPT-5.2 CodexOpenAI
78.2%
$0.19
23
GPT-5.6 Luna Max EffortOpenAI
78.0%
$0.17
24
Claude 4.6 Sonnet Thinking Medium EffortAnthropic
77.9%
$0.31
25
Grok 4.7 xHighxAI
76.9%
$0.72
26
Qwen3.8 27BAlibaba · open weights
76.6%
$0.094
27
Muse Spark 1.2 xHigh EffortMeta
76.5%
$0.38
28
GLM-5.3 FlashZ.AI · open weights
76.4%
$0.031
29
Minimax M3MiniMax
76.2%
$0.060
30
Ox Alpha MaxStealth
75.8%
–
31
Claude 5 Opus Thinking Max EffortAnthropic
74.6%
$0.70
32
Claude 4.5 Opus Thinking High EffortAnthropic
74.4%
$0.61
33
Qwen 3.8 Flash NextAlibaba · open weights
74.2%
$0.042
34
Grok 4.6 xHighxAI
73.9%
$0.21
35
GLM-5.2Z.AI · open weights
73.7%
$0.23
36
GPT-6 Luna Max EffortOpenAI
73.4%
$0.026
37
Grok 4.5xAI
73.0%
$0.13
38
Inkling xHigh EffortThinking Machines · open weights
72.8%
$0.31
39
Muse Spark 1.1 xHigh EffortMeta
72.5%
$0.20
40
Qwen 3.7 MaxAlibaba
71.8%
$0.18
41
Claude Sonnet 5 xHigh EffortAnthropic
71.7%
$0.51
42
Grok Build 0.1xAI
70.8%
$0.024
43
GPT-5.4 Mini xHighOpenAI
70.8%
$0.33
44
Qwen 3.6 27BAlibaba · open weights
70.4%
$0.20
45
GLM-5.3Z.AI · open weights
70.2%
$0.45
46
Claude 4.6 Opus Thinking High EffortAnthropic
69.9%
$0.40
47
Qwen 3.6 PlusAlibaba
69.9%
$0.23
48
Gemini 3.7 Flash HighGoogle
68.0%
$0.16
49
GPT-5.4 Nano xHighOpenAI
67.6%
$0.091
50
Claude 4.8 Opus Thinking Max EffortAnthropic
66.0%
$0.98
51
Kimi K2.6 ThinkingMoonshot AI · open weights
65.1%
$0.17
52
Gemini 3.5 Flash HighGoogle
64.9%
$0.25
53
Gemini 3.6 Flash HighGoogle
63.0%
$0.23
54
Kimi K2.7 CodeMoonshot AI · open weights
62.7%
$0.10
55
Grok 4.3xAI
55.8%
$0.061
56
Nemotron 3 Ultra 550B A55BNVIDIA · open weights
54.5%
$0.37
57
Gemini 3.8 Flash HighGoogle
54.0%
$0.31
58
Gemini 3.5 Flash-Lite HighGoogle
53.2%
$0.069

Need a model picked for your use case?

Benchmarks rank models on other people's tasks. For a business workflow I test the shortlist on your own data, costs and privacy requirements, and recommend one.

AI consulting