Skip to content

/ LLM benchmarks / Instruction Following

Instruction following benchmarks

Adherence to formatting constraints and complex instructions, from LiveBench.

DataLiveBenchrelease 2026-06-25fetched

LiveBench Instruction Following · CC BY-SA 4.0

View original source
LiveBench Instruction Following leaderboard, 58 models
#ModelScoreCost/solved task
1
Gemini 3.8 Flash HighGoogle
81.4%
$0.31
2
Gemini 3.7 Flash HighGoogle
79.9%
$0.16
3
Gemini 3.1 Pro Preview HighGoogle
79.1%
$0.29
4
Muse Spark 1.3 xHigh EffortMeta
78.0%
$0.22
5
Qwen 3.8 Flash NextAlibaba · open weights
77.1%
$0.042
6
Claude Fable 5 Max EffortAnthropic
75.8%
$1.44
7
GPT-6 Astra Max EffortOpenAI
75.6%
$0.74
8
Gemini 3.5 Flash HighGoogle
75.6%
$0.25
9
Gemini 3.6 Flash HighGoogle
75.4%
$0.23
10
Grok 4.7 xHighxAI
75.3%
$0.72
11
Muse Spark 1.2 xHigh EffortMeta
74.3%
$0.38
12
GPT-6.1 Sol Max EffortOpenAI
74.2%
$0.14
13
Qwen 3.8 MaxAlibaba · open weights
74.1%
$0.28
14
Qwen 3.7 MaxAlibaba
74.0%
$0.18
15
Nemotron 3 Ultra 550B A55BNVIDIA · open weights
73.4%
$0.37
16
Claude Fable 5.1 Max EffortAnthropic
73.0%
$1.21
17
Qwen3.8 27BAlibaba · open weights
72.7%
$0.094
18
Claude 4.8 Opus Thinking Max EffortAnthropic
72.0%
$0.98
19
Grok 4.6 xHighxAI
71.9%
$0.21
20
GPT-5.6 Sol Max EffortOpenAI
71.8%
$0.52
21
Grok 4.5xAI
71.5%
$0.13
22
Kimi K3Moonshot AI · open weights
71.4%
$0.35
23
DeepSeek V4 Flash Vision ExpDeepSeek · open weights
71.0%
$0.051
24
GPT-5.5 Thinking xHigh EffortOpenAI
70.7%
$0.43
25
Claude Sonnet 5.5 xHigh EffortAnthropic
70.5%
$0.14
26
GPT-5.4 Thinking xHigh EffortOpenAI
70.2%
$0.39
27
Inkling xHigh EffortThinking Machines · open weights
70.1%
$0.31
28
DeepSeek V4.1 Flash Max EffortDeepSeek · open weights
70.0%
$0.029
29
Muse Spark 1.1 xHigh EffortMeta
69.6%
$0.20
30
GLM-5.3Z.AI · open weights
69.3%
$0.45
31
GPT-6 Sol Max EffortOpenAI
68.6%
$0.27
32
DeepSeek V4 Pro 0813DeepSeek · open weights
67.7%
$0.044
33
GPT-5.4 Nano xHighOpenAI
67.2%
$0.091
34
Gemini 3.5 Flash-Lite HighGoogle
67.2%
$0.069
35
Claude 4.7 Opus Thinking xHigh EffortAnthropic
66.7%
$0.53
36
GPT-5.2 CodexOpenAI
66.4%
$0.19
37
Claude 5.5 Opus Thinking Max EffortAnthropic
65.7%
$0.80
38
DeepSeek V4 Flash 0731DeepSeek · open weights
65.5%
$0.060
39
Grok Build 0.1xAI
65.2%
$0.024
40
GPT-5.6 Terra Max EffortOpenAI
64.6%
$0.35
41
Kimi K2.6 ThinkingMoonshot AI · open weights
64.4%
$0.17
42
Claude Sonnet 5 xHigh EffortAnthropic
63.9%
$0.51
43
Claude 5 Opus Thinking Max EffortAnthropic
63.8%
$0.70
44
Claude 4.6 Opus Thinking High EffortAnthropic
63.3%
$0.40
45
Claude 4.6 Sonnet Thinking Medium EffortAnthropic
63.2%
$0.31
46
Grok 4.3xAI
62.8%
$0.061
47
Claude 4.5 Opus Thinking High EffortAnthropic
62.5%
$0.61
48
GLM-5.2Z.AI · open weights
62.3%
$0.23
49
GPT-5.2 HighOpenAI
61.8%
$0.23
50
Ox Alpha MaxStealth
60.3%
–
51
GPT-5.6 Luna Max EffortOpenAI
60.1%
$0.17
52
GPT-5.4 Mini xHighOpenAI
59.8%
$0.33
53
Qwen 3.6 PlusAlibaba
58.3%
$0.23
54
Minimax M3MiniMax
57.5%
$0.060
55
Kimi K2.7 CodeMoonshot AI · open weights
56.3%
$0.10
56
GPT-6 Luna Max EffortOpenAI
55.9%
$0.026
57
Qwen 3.6 27BAlibaba · open weights
53.2%
$0.20
58
GLM-5.3 FlashZ.AI · open weights
52.8%
$0.031

Need a model picked for your use case?

Benchmarks rank models on other people's tasks. For a business workflow I test the shortlist on your own data, costs and privacy requirements, and recommend one.

AI consulting