Zum Inhalt springen

/ LLM-Benchmarks / Instruction Following

Instruction Following Benchmark: welches Modell sich an Vorgaben hält

Einhaltung von Formatvorgaben und komplexen Anweisungen, aus LiveBench.

DatenLiveBenchRelease 2026-06-25abgerufen

LiveBench Instruction Following · CC BY-SA 4.0

Originalquelle ansehen
Leaderboard LiveBench Instruction Following, 58 Modelle
#ModellWertungKosten pro gelöster Aufgabe
1
Gemini 3.8 Flash HighGoogle
81.4%
$0.31
2
Gemini 3.7 Flash HighGoogle
79.9%
$0.16
3
Gemini 3.1 Pro Preview HighGoogle
79.1%
$0.29
4
Muse Spark 1.3 xHigh EffortMeta
78.0%
$0.22
5
Qwen 3.8 Flash NextAlibaba · Open Weights
77.1%
$0.042
6
Claude Fable 5 Max EffortAnthropic
75.8%
$1.44
7
GPT-6 Astra Max EffortOpenAI
75.6%
$0.74
8
Gemini 3.5 Flash HighGoogle
75.6%
$0.25
9
Gemini 3.6 Flash HighGoogle
75.4%
$0.23
10
Grok 4.7 xHighxAI
75.3%
$0.72
11
Muse Spark 1.2 xHigh EffortMeta
74.3%
$0.38
12
GPT-6.1 Sol Max EffortOpenAI
74.2%
$0.14
13
Qwen 3.8 MaxAlibaba · Open Weights
74.1%
$0.28
14
Qwen 3.7 MaxAlibaba
74.0%
$0.18
15
Nemotron 3 Ultra 550B A55BNVIDIA · Open Weights
73.4%
$0.37
16
Claude Fable 5.1 Max EffortAnthropic
73.0%
$1.21
17
Qwen3.8 27BAlibaba · Open Weights
72.7%
$0.094
18
Claude 4.8 Opus Thinking Max EffortAnthropic
72.0%
$0.98
19
Grok 4.6 xHighxAI
71.9%
$0.21
20
GPT-5.6 Sol Max EffortOpenAI
71.8%
$0.52
21
Grok 4.5xAI
71.5%
$0.13
22
Kimi K3Moonshot AI · Open Weights
71.4%
$0.35
23
DeepSeek V4 Flash Vision ExpDeepSeek · Open Weights
71.0%
$0.051
24
GPT-5.5 Thinking xHigh EffortOpenAI
70.7%
$0.43
25
Claude Sonnet 5.5 xHigh EffortAnthropic
70.5%
$0.14
26
GPT-5.4 Thinking xHigh EffortOpenAI
70.2%
$0.39
27
Inkling xHigh EffortThinking Machines · Open Weights
70.1%
$0.31
28
DeepSeek V4.1 Flash Max EffortDeepSeek · Open Weights
70.0%
$0.029
29
Muse Spark 1.1 xHigh EffortMeta
69.6%
$0.20
30
GLM-5.3Z.AI · Open Weights
69.3%
$0.45
31
GPT-6 Sol Max EffortOpenAI
68.6%
$0.27
32
DeepSeek V4 Pro 0813DeepSeek · Open Weights
67.7%
$0.044
33
GPT-5.4 Nano xHighOpenAI
67.2%
$0.091
34
Gemini 3.5 Flash-Lite HighGoogle
67.2%
$0.069
35
Claude 4.7 Opus Thinking xHigh EffortAnthropic
66.7%
$0.53
36
GPT-5.2 CodexOpenAI
66.4%
$0.19
37
Claude 5.5 Opus Thinking Max EffortAnthropic
65.7%
$0.80
38
DeepSeek V4 Flash 0731DeepSeek · Open Weights
65.5%
$0.060
39
Grok Build 0.1xAI
65.2%
$0.024
40
GPT-5.6 Terra Max EffortOpenAI
64.6%
$0.35
41
Kimi K2.6 ThinkingMoonshot AI · Open Weights
64.4%
$0.17
42
Claude Sonnet 5 xHigh EffortAnthropic
63.9%
$0.51
43
Claude 5 Opus Thinking Max EffortAnthropic
63.8%
$0.70
44
Claude 4.6 Opus Thinking High EffortAnthropic
63.3%
$0.40
45
Claude 4.6 Sonnet Thinking Medium EffortAnthropic
63.2%
$0.31
46
Grok 4.3xAI
62.8%
$0.061
47
Claude 4.5 Opus Thinking High EffortAnthropic
62.5%
$0.61
48
GLM-5.2Z.AI · Open Weights
62.3%
$0.23
49
GPT-5.2 HighOpenAI
61.8%
$0.23
50
Ox Alpha MaxStealth
60.3%
–
51
GPT-5.6 Luna Max EffortOpenAI
60.1%
$0.17
52
GPT-5.4 Mini xHighOpenAI
59.8%
$0.33
53
Qwen 3.6 PlusAlibaba
58.3%
$0.23
54
Minimax M3MiniMax
57.5%
$0.060
55
Kimi K2.7 CodeMoonshot AI · Open Weights
56.3%
$0.10
56
GPT-6 Luna Max EffortOpenAI
55.9%
$0.026
57
Qwen 3.6 27BAlibaba · Open Weights
53.2%
$0.20
58
GLM-5.3 FlashZ.AI · Open Weights
52.8%
$0.031

Sie brauchen ein Modell für Ihren konkreten Fall?

Benchmarks bewerten Modelle anhand fremder Aufgaben. Für einen Geschäftsprozess teste ich die engere Wahl mit Ihren eigenen Daten, Kosten und Datenschutzvorgaben und empfehle eines.

KI-Beratung