/ LLM-Benchmarks
LLM-Benchmarks: das beste Modell für jede Aufgabe
Der aktuelle Spitzenreiter pro Aufgabe bei Arena und LiveBench, mit Preis oder Kosten pro Aufgabe, wo die Quelle sie ausweist. Jeder Wert stammt von der Quelle selbst.
DatenText Arena02.10.2026Code Arena01.10.2026LiveBenchRelease 2026-06-25abgerufen
/ Das beste Modell für die Aufgabe
- CodingClaude Opus 5.5 MaxAnthropic1815Elo$4.00 / $20.00 pro 1 Mio. TokensCode Arena
- Texte und ChatGemini 4 Argon HighGoogle1525Elo$2.00 / $10.00 pro 1 Mio. TokensText Arena
- ReasoningGPT-6 Astra Max EffortOpenAI92.7%$0.74 pro gelöster Aufgabe, LiveBench gesamtLiveBench Reasoning
- MathematikClaude 5.5 Opus Thinking Max EffortAnthropic97.1%$0.80 pro gelöster Aufgabe, LiveBench gesamtLiveBench Math
- DatenanalyseGPT-6 Astra Max EffortOpenAI83.0%$0.74 pro gelöster Aufgabe, LiveBench gesamtLiveBench Data Analysis
- Agentic CodingDeepSeek V4.1 Flash Max EffortDeepSeek · Open Weights77.3%$0.029 pro gelöster Aufgabe, LiveBench gesamtLiveBench Agentic Coding
- Instruction FollowingGemini 3.8 Flash HighGoogle81.4%$0.31 pro gelöster Aufgabe, LiveBench gesamtLiveBench Instruction Following
- Beste Preis-LeistungDeepSeek V4.1 Flash Max EffortDeepSeek · Open Weights81.1%gesamt$0.029 pro gelöster Aufgabe, LiveBench gesamtLiveBench Overall · berechnet
- Bestes Open-Weights-ModellDeepSeek V4.1 Flash Max EffortDeepSeek · Open Weights81.1%gesamt$0.029 pro gelöster Aufgabe, LiveBench gesamtLiveBench Overall · berechnet
- Günstigstes starkes ModellDeepSeek V4.1 Flash Max EffortDeepSeek · Open Weights81.1%gesamt$0.029 pro gelöster Aufgabe, LiveBench gesamtLiveBench Overall · berechnet
- Beste Preis-Leistung: Höchster LiveBench-Gesamtwert pro Dollar, unter Modellen höchstens 5 Punkte hinter dem Spitzenreiter.
- Bestes Open-Weights-Modell: Höchster LiveBench-Gesamtwert unter den Open-Weights-Modellen.
- Günstigstes starkes Modell: Tiefste Kosten pro gelöster Aufgabe bei mindestens 90 % des Gesamtwerts des Spitzenreiters.
Kosten und Qualität
Jeder Punkt ist ein Modell bei LiveBench: Gesamtwert gegen Kosten pro gelöster Aufgabe. Die Linie ist die Pareto-Front, auf der kein anderes Modell zugleich günstiger und besser ist.
Seitlich wischen für die ganze Grafik.
57 Modelle. Auf der Front, vom günstigsten zum besten: Grok Build 0.1 ($0.024, 67.8%), GPT-6 Luna Max Effort ($0.026, 72.0%), DeepSeek V4.1 Flash Max Effort ($0.029, 81.1%), GPT-6.1 Sol Max Effort ($0.14, 81.6%), GPT-6 Astra Max Effort ($0.74, 82.2%), Claude 5.5 Opus Thinking Max Effort ($0.80, 83.2%), Claude Fable 5.1 Max Effort ($1.21, 83.4%).
Daten der Grafik als Tabelle anzeigen
| Modell | Organisation | Gesamt | Kosten pro gelöster Aufgabe | Open Weights | Front |
|---|---|---|---|---|---|
| Claude Fable 5.1 Max Effort | Anthropic | 83.4 | $1.21 | ja | |
| Claude 5.5 Opus Thinking Max Effort | Anthropic | 83.2 | $0.80 | ja | |
| Claude Fable 5 Max Effort | Anthropic | 83.0 | $1.44 | ||
| GPT-6 Astra Max Effort | OpenAI | 82.2 | $0.74 | ja | |
| GPT-6.1 Sol Max Effort | OpenAI | 81.6 | $0.14 | ja | |
| Muse Spark 1.3 xHigh Effort | Meta | 81.6 | $0.22 | ||
| DeepSeek V4.1 Flash Max Effort | DeepSeek | 81.1 | $0.029 | ja | ja |
| GPT-5.6 Sol Max Effort | OpenAI | 81.0 | $0.52 | ||
| GPT-5.5 Thinking xHigh Effort | OpenAI | 80.2 | $0.43 | ||
| Claude 5 Opus Thinking Max Effort | Anthropic | 80.1 | $0.70 | ||
| GPT-6 Sol Max Effort | OpenAI | 79.3 | $0.27 | ||
| Kimi K3 | Moonshot AI | 79.2 | $0.35 | ja | |
| Gemini 3.7 Flash High | 78.8 | $0.16 | |||
| Qwen 3.8 Max | Alibaba | 78.5 | $0.28 | ja | |
| Grok 4.6 xHigh | xAI | 78.0 | $0.21 | ||
| GPT-5.4 Thinking xHigh Effort | OpenAI | 78.0 | $0.39 | ||
| Muse Spark 1.2 xHigh Effort | Meta | 78.0 | $0.38 | ||
| GPT-5.6 Terra Max Effort | OpenAI | 77.9 | $0.35 | ||
| Claude Sonnet 5.5 xHigh Effort | Anthropic | 77.8 | $0.14 | ||
| DeepSeek V4 Pro 0813 | DeepSeek | 77.4 | $0.044 | ja | |
| Grok 4.7 xHigh | xAI | 77.4 | $0.72 | ||
| Gemini 3.1 Pro Preview High | 77.0 | $0.29 | |||
| DeepSeek V4 Flash Vision Exp | DeepSeek | 76.8 | $0.051 | ja | |
| Claude 4.7 Opus Thinking xHigh Effort | Anthropic | 76.5 | $0.53 | ||
| Claude 4.8 Opus Thinking Max Effort | Anthropic | 76.2 | $0.98 | ||
| Qwen 3.8 Flash Next | Alibaba | 76.2 | $0.042 | ja | |
| GLM-5.3 | Z.AI | 76.1 | $0.45 | ja | |
| Claude Sonnet 5 xHigh Effort | Anthropic | 76.0 | $0.51 | ||
| Gemini 3.8 Flash High | 75.8 | $0.31 | |||
| Grok 4.5 | xAI | 75.8 | $0.13 | ||
| Muse Spark 1.1 xHigh Effort | Meta | 75.3 | $0.20 | ||
| Qwen3.8 27B | Alibaba | 75.3 | $0.094 | ja | |
| Gemini 3.5 Flash High | 74.6 | $0.25 | |||
| GPT-5.2 High | OpenAI | 74.6 | $0.23 | ||
| Claude 4.6 Opus Thinking High Effort | Anthropic | 74.5 | $0.40 | ||
| DeepSeek V4 Flash 0731 | DeepSeek | 74.2 | $0.060 | ja | |
| GPT-5.2 Codex | OpenAI | 74.0 | $0.19 | ||
| Gemini 3.6 Flash High | 73.6 | $0.23 | |||
| GPT-5.6 Luna Max Effort | OpenAI | 73.6 | $0.17 | ||
| GLM-5.2 | Z.AI | 73.2 | $0.23 | ja | |
| Qwen 3.7 Max | Alibaba | 73.1 | $0.18 | ||
| Claude 4.6 Sonnet Thinking Medium Effort | Anthropic | 73.0 | $0.31 | ||
| Claude 4.5 Opus Thinking High Effort | Anthropic | 72.6 | $0.61 | ||
| GPT-6 Luna Max Effort | OpenAI | 72.0 | $0.026 | ja | |
| Inkling xHigh Effort | Thinking Machines | 71.9 | $0.31 | ja | |
| GLM-5.3 Flash | Z.AI | 71.6 | $0.031 | ja | |
| Kimi K2.6 Thinking | Moonshot AI | 70.5 | $0.17 | ja | |
| GPT-5.4 Nano xHigh | OpenAI | 69.6 | $0.091 | ||
| Qwen 3.6 Plus | Alibaba | 68.9 | $0.23 | ||
| Kimi K2.7 Code | Moonshot AI | 68.4 | $0.10 | ja | |
| Grok Build 0.1 | xAI | 67.8 | $0.024 | ja | |
| Nemotron 3 Ultra 550B A55B | NVIDIA | 67.4 | $0.37 | ja | |
| Minimax M3 | MiniMax | 67.3 | $0.060 | ||
| GPT-5.4 Mini xHigh | OpenAI | 66.4 | $0.33 | ||
| Qwen 3.6 27B | Alibaba | 64.0 | $0.20 | ja | |
| Gemini 3.5 Flash-Lite High | 63.9 | $0.069 | |||
| Grok 4.3 | xAI | 62.3 | $0.061 |
Alle Leaderboards nach Kategorie
Coding-Benchmarks
Code-Generierung und Webentwicklung aus Code Arena (Elo) und LiveBench.
2 Leaderboards: Code Arena, LiveBench Coding
Leaderboards ansehenAgentic-Coding-Benchmarks
Mehrstufige Code-Bearbeitung und Tool-Nutzung in agentischen Workflows, aus LiveBench.
1 Leaderboard: LiveBench Agentic Coding
Leaderboards ansehenReasoning-Benchmarks
Logik, Deduktion und Schlussfolgerung aus LiveBench, dazu der LiveBench-Gesamtwert.
2 Leaderboards: LiveBench Reasoning, LiveBench Overall
Leaderboards ansehenMathematik-Benchmarks
Numerisches Denken und mathematische Problemlösung aus LiveBench.
1 Leaderboard: LiveBench Math
Leaderboards ansehenDatenanalyse-Benchmarks
Strukturierte Dateninterpretation, Abfragen und Analyse aus LiveBench.
1 Leaderboard: LiveBench Data Analysis
Leaderboards ansehenSprach-Benchmarks
Chat-Präferenz-Rankings (Text Arena Elo) und Sprachverständnis (LiveBench).
2 Leaderboards: Text Arena, LiveBench Language
Leaderboards ansehenInstruction-Following-Benchmarks
Einhaltung von Formatvorgaben und komplexen Anweisungen, aus LiveBench.
1 Leaderboard: LiveBench Instruction Following
Leaderboards ansehen
Quellen und Methode
Ich rufe drei öffentliche Leaderboards zweimal täglich ab, um 06:00 und 18:00 UTC, und veröffentliche ihre Zahlen unverändert. Werte, Preise und Kosten stammen von den Quellen, nicht von mir. Selbst berechnet sind nur die Rangfolge der sieben LiveBench-Kategorientabellen, die Grenze zwischen Kosten und Qualität und die drei als berechnet markierten Empfehlungen.
JSON-API
Jede Kategorie gibt es als JSON mit offenem CORS, zum Beispiel /api/benchmarks/coding
- Misst
- Menschliche Präferenz: Personen vergleichen zwei anonyme Antworten auf ihren eigenen Prompt und stimmen ab. Die Werte sind Elo-artige Ratings mit Konfidenzintervall.
- Stand
- Stand der Quelle 02.10.2026 · abgerufen 03.10.2026 10:46 UTC · 413 Modelle
- Lizenz
- Daten von Arena (arena.ai), auch als offener Datensatz unter CC BY 4.0 veröffentlicht.
- Misst
- Menschliche Präferenz bei Webentwicklungsaufgaben, inklusive agentischer Coding-Workflows, gleich bewertet.
- Stand
- Stand der Quelle 01.10.2026 · abgerufen 03.10.2026 10:46 UTC · 138 Modelle
- Lizenz
- Daten von Arena (arena.ai), auch als offener Datensatz unter CC BY 4.0 veröffentlicht.
- Misst
- 23 objektive Aufgaben in 7 Kategorien mit überprüfbaren Antworten, dazu die Kosten pro gelöster Aufgabe. Die Fragen werden alle sechs Monate erneuert.
- Stand
- Release 2026-06-25 · abgerufen 03.10.2026 10:46 UTC · 58 Modelle · Neue Modelle kommen zwischen den Releases dazu.
- Lizenz
- Daten von LiveBench (livebench.ai) unter CC BY-SA 4.0. Die LiveBench-Tabellen auf dieser Seite stehen unter derselben Lizenz.
Sie brauchen ein Modell für Ihren konkreten Fall?
Benchmarks bewerten Modelle anhand fremder Aufgaben. Für einen Geschäftsprozess teste ich die engere Wahl mit Ihren eigenen Daten, Kosten und Datenschutzvorgaben und empfehle eines.