/ LLM-Benchmarks / live
LLM-Benchmark live: neue Modelle und Rangänderungen
Was sich bei Code Arena, Text Arena und LiveBench bewegt hat. Jedes Modell, das neu in einer Rangliste auftaucht, jede neue Nummer 1 und jedes Überholen in einer Top 10, zweimal täglich aus den Ranglisten gelesen.
Welches Modell ist gerade das beste? Die aktuellen Spitzenreiter pro Aufgabe
Letzter Abruf pro Quelle
Der Abruf ist für 06:00 und 18:00 UTC geplant und läuft oft Stunden später. Die Tabelle zeigt, wann jeder Lauf tatsächlich abgerufen hat. Das Quelldatum ist der Stand, den die Rangliste selbst angibt, und kann älter sein als der Abruf.
| Quelle | Abgerufen | Quelldatum | Modelle |
|---|---|---|---|
| Text Arena | 02.10.2026 | 413 | |
| Code Arena | 01.10.2026 | 138 | |
| LiveBench | Release 2026-06-25 | 58 |
Zweimal täglich, geplant 06:00 und 18:00 UTC
Neue Nummer 1
Jeder Wechsel an der Spitze einer Rangliste in den letzten 90 Tagen.
- Gemini 4 Argon High (Google) übernimmt Platz 1 bei Text Arena
- Claude Opus 5.5 High (Anthropic) übernimmt Platz 1 bei Text Arena
- Claude Opus 5.5 Max (Anthropic) übernimmt Platz 1 bei Code Arena
- Claude Fable 5 High (Anthropic) übernimmt Platz 1 bei Text Arena
- GPT-6 Astra Max (OpenAI) übernimmt Platz 1 bei Code Arena
- Claude Fable 5.1 Max (Anthropic) übernimmt Platz 1 bei Code Arena
- Claude Opus 5 Max (Anthropic) übernimmt Platz 1 bei Code Arena
- Kimi K3 (Moonshot AI) übernimmt Platz 1 bei Code Arena
- GPT-5.6 Sol xHigh (codex-harness) (OpenAI) übernimmt Platz 1 bei Code Arena (vorher #2)
Rangänderungen, Tag für Tag
Die letzten 30 Tage. Ein Aufstieg zählt, wenn ein Modell in einer Top 10 ein anderes überholt und sich sein Rang ändert. Modelle, die zurückfallen, werden gezählt, nicht einzeln aufgeführt.
- GPT-6.1 Sol Max (OpenAI): Text Arena neu auf #21
- Claude Sonnet 5.5 xHigh (Anthropic): Text Arena neu auf #45
- Step 5 Preview (Stepfun): Text Arena neu auf #74
- Gemini 3.8 Flash High (Google): Text Arena steigt von #11 auf #8
- 3 Modelle rutschen nach unten
- Claude Sonnet 5.5 xHigh (Anthropic): Code Arena neu auf #3
- Gemini 4 Argon High (Google): übernimmt Platz 1 bei Text Arena, Code Arena neu auf #8
- GPT-6.1 Sol Max Effort (OpenAI): LiveBench Data Analysis neu auf #2, LiveBench Language neu auf #2, LiveBench Reasoning neu auf #2, LiveBench Math neu auf #4, LiveBench Overall neu auf #5, LiveBench Instruction Following neu auf #12, LiveBench Coding neu auf #17, LiveBench Agentic Coding neu auf #24
- GPT-6.1 Sol Max (OpenAI): Code Arena neu auf #3
- Claude Sonnet 5.5 High (Anthropic): Code Arena neu auf #4
- Muse Spark 1.3 Max (Meta): Text Arena steigt von #9 auf #8
- 3 Modelle rutschen nach unten
- Claude Opus 5.5 High (Anthropic): übernimmt Platz 1 bei Text Arena
- MiMo V2.6 Pro (Xiaomi): Text Arena neu auf #23
- DeepSeek V4.1 Flash Max (DeepSeek): Text Arena neu auf #29
- GPT-6 Sol Max (OpenAI): Text Arena neu auf #60
- MiMo V2.6 Flash (Xiaomi): Text Arena neu auf #71
- GPT-6 Luna Max (OpenAI): Text Arena neu auf #86
- Grok 4.7 xHigh (SpaceXAI): Text Arena neu auf #92
- 2 Modelle rutschen nach unten
- Step 5 Preview High (Stepfun): Code Arena neu auf #29
- Claude Opus 5.5 Max (Anthropic): übernimmt Platz 1 bei Code Arena
- MiMo V2.6 Pro (Xiaomi): Code Arena neu auf #19
- GPT-6 Luna Max (OpenAI): Code Arena neu auf #24
- 1 Modell rutscht nach unten
- GPT-6 Sol Max (OpenAI): Code Arena neu auf #4
- 2 Modelle rutschen nach unten
- Grok 4.7 xHigh (SpaceXAI): Code Arena neu auf #10
- Qwen 3.8 Max (Alibaba): Code Arena steigt von #6 auf #4
- Claude Opus 5 High (Anthropic): Code Arena steigt von #7 auf #6
- 3 Modelle rutschen nach unten
- Claude Fable 5 High (Anthropic): übernimmt Platz 1 bei Text Arena, Code Arena neu auf #10
- Muse Spark 1.2 (xHigh) (Meta): Text Arena steigt von #5 auf #4
- Claude Opus 4.7 (Anthropic): Text Arena steigt von #8 auf #7
- Gemini 3.8 Flash High (Google): Text Arena steigt von #11 auf #9
- 3 Modelle rutschen nach unten
- Muse Spark 1.3 Max (Meta): Text Arena neu auf #7
- DeepSeek V4.1 Flash Max (DeepSeek): Code Arena neu auf #16
- GPT-6 Astra Max (OpenAI): Text Arena neu auf #24
- Claude Opus 4.7 High (Anthropic): Text Arena steigt von #4 auf #3
- Muse Spark 1.1 (Meta): Text Arena steigt von #10 auf #8
- 2 Modelle rutschen nach unten
- Muse Spark 1.3 Max (Meta): Code Arena neu auf #8
- 2 Modelle rutschen nach unten
- GPT-6 Astra Max (OpenAI): übernimmt Platz 1 bei Code Arena
- Muse Spark 1.3 (xHigh) (Meta): Code Arena neu auf #11
- Claude Fable 5 (Anthropic): Code Arena steigt von #8 auf #7
- Qwen 3.8 Flash Next (Alibaba): Code Arena steigt von #10 auf #9
- 4 Modelle rutschen nach unten
Älteste erfasste Änderung: 09.04.2026.
Sie brauchen ein Modell für Ihren konkreten Fall?
Benchmarks bewerten Modelle anhand fremder Aufgaben. Für einen Geschäftsprozess teste ich die engere Wahl mit Ihren eigenen Daten, Kosten und Datenschutzvorgaben und empfehle eines.