Zum Inhalt springen

/ LLM-Benchmarks / Reasoning

Reasoning-Modell im Vergleich: wer am besten schlussfolgert

Logik, Deduktion und Schlussfolgerung aus LiveBench, dazu der LiveBench-Gesamtwert.

DatenLiveBenchRelease 2026-06-25abgerufen

Leaderboard LiveBench Reasoning, 58 Modelle
#ModellWertungKosten pro gelöster Aufgabe
1
GPT-6 Astra Max EffortOpenAI
92.7%
$0.74
2
GPT-6.1 Sol Max EffortOpenAI
92.6%
$0.14
3
Claude 5.5 Opus Thinking Max EffortAnthropic
92.2%
$0.80
4
Claude Fable 5.1 Max EffortAnthropic
91.7%
$1.21
5
GPT-5.6 Sol Max EffortOpenAI
91.7%
$0.52
6
Claude 5 Opus Thinking Max EffortAnthropic
91.2%
$0.70
7
Kimi K3Moonshot AI · Open Weights
90.7%
$0.35
8
GPT-5.6 Terra Max EffortOpenAI
90.6%
$0.35
9
Grok 4.6 xHighxAI
90.5%
$0.21
10
Muse Spark 1.2 xHigh EffortMeta
90.0%
$0.38
11
Claude Fable 5 Max EffortAnthropic
89.7%
$1.44
12
Muse Spark 1.3 xHigh EffortMeta
89.7%
$0.22
13
GPT-5.5 Thinking xHigh EffortOpenAI
89.7%
$0.43
14
Gemini 3.8 Flash HighGoogle
89.3%
$0.31
15
Claude 4.8 Opus Thinking Max EffortAnthropic
89.2%
$0.98
16
GPT-6 Sol Max EffortOpenAI
88.7%
$0.27
17
Claude Sonnet 5 xHigh EffortAnthropic
88.7%
$0.51
18
Claude 4.6 Opus Thinking High EffortAnthropic
88.7%
$0.40
19
Qwen 3.8 MaxAlibaba · Open Weights
88.2%
$0.28
20
GPT-5.4 Thinking xHigh EffortOpenAI
88.1%
$0.39
21
Gemini 3.7 Flash HighGoogle
87.8%
$0.16
22
Muse Spark 1.1 xHigh EffortMeta
87.7%
$0.20
23
Qwen 3.8 Flash NextAlibaba · Open Weights
87.4%
$0.042
24
Claude 4.7 Opus Thinking xHigh EffortAnthropic
87.2%
$0.53
25
Grok 4.5xAI
87.2%
$0.13
26
Claude Sonnet 5.5 xHigh EffortAnthropic
86.8%
$0.14
27
DeepSeek V4.1 Flash Max EffortDeepSeek · Open Weights
86.7%
$0.029
28
DeepSeek V4 Flash 0731DeepSeek · Open Weights
86.6%
$0.060
29
DeepSeek V4 Pro 0813DeepSeek · Open Weights
85.8%
$0.044
30
GLM-5.3Z.AI · Open Weights
85.8%
$0.45
31
GPT-5.6 Luna Max EffortOpenAI
85.6%
$0.17
32
DeepSeek V4 Flash Vision ExpDeepSeek · Open Weights
85.4%
$0.051
33
Gemini 3.6 Flash HighGoogle
85.1%
$0.23
34
Claude 4.6 Sonnet Thinking Medium EffortAnthropic
84.8%
$0.31
35
Gemini 3.1 Pro Preview HighGoogle
84.0%
$0.29
36
Qwen 3.7 MaxAlibaba
83.3%
$0.18
37
GPT-5.2 HighOpenAI
83.2%
$0.23
38
Kimi K2.7 CodeMoonshot AI · Open Weights
82.8%
$0.10
39
Grok 4.7 xHighxAI
82.7%
$0.72
40
Gemini 3.5 Flash HighGoogle
82.0%
$0.25
41
GPT-6 Luna Max EffortOpenAI
81.8%
$0.026
42
GPT-5.4 Nano xHighOpenAI
81.1%
$0.091
43
Claude 4.5 Opus Thinking High EffortAnthropic
80.1%
$0.61
44
Qwen3.8 27BAlibaba · Open Weights
80.0%
$0.094
45
Kimi K2.6 ThinkingMoonshot AI · Open Weights
79.4%
$0.17
46
GLM-5.2Z.AI · Open Weights
78.6%
$0.23
47
Inkling xHigh EffortThinking Machines · Open Weights
78.3%
$0.31
48
GPT-5.2 CodexOpenAI
77.7%
$0.19
49
GLM-5.3 FlashZ.AI · Open Weights
77.6%
$0.031
50
Ox Alpha MaxStealth
76.6%
–
51
Grok Build 0.1xAI
76.4%
$0.024
52
Qwen 3.6 PlusAlibaba
75.8%
$0.23
53
Nemotron 3 Ultra 550B A55BNVIDIA · Open Weights
74.7%
$0.37
54
Minimax M3MiniMax
74.5%
$0.060
55
GPT-5.4 Mini xHighOpenAI
71.3%
$0.33
56
Grok 4.3xAI
70.8%
$0.061
57
Qwen 3.6 27BAlibaba · Open Weights
70.3%
$0.20
58
Gemini 3.5 Flash-Lite HighGoogle
60.2%
$0.069

Sie brauchen ein Modell für Ihren konkreten Fall?

Benchmarks bewerten Modelle anhand fremder Aufgaben. Für einen Geschäftsprozess teste ich die engere Wahl mit Ihren eigenen Daten, Kosten und Datenschutzvorgaben und empfehle eines.

KI-Beratung