Zum Inhalt springen

/ LLM-Benchmarks / live

LLM-Benchmark live: neue Modelle und Rangänderungen

Was sich bei Code Arena, Text Arena und LiveBench bewegt hat. Jedes Modell, das neu in einer Rangliste auftaucht, jede neue Nummer 1 und jedes Überholen in einer Top 10, zweimal täglich aus den Ranglisten gelesen.

Welches Modell ist gerade das beste? Die aktuellen Spitzenreiter pro Aufgabe

Letzter Abruf pro Quelle

Der Abruf ist für 06:00 und 18:00 UTC geplant und läuft oft Stunden später. Die Tabelle zeigt, wann jeder Lauf tatsächlich abgerufen hat. Das Quelldatum ist der Stand, den die Rangliste selbst angibt, und kann älter sein als der Abruf.

Letzter Abruf pro Quelle
QuelleAbgerufenQuelldatumModelle
Text Arena02.10.2026413
Code Arena01.10.2026138
LiveBenchRelease 2026-06-2558

Zweimal täglich, geplant 06:00 und 18:00 UTC

Neue Nummer 1

Jeder Wechsel an der Spitze einer Rangliste in den letzten 90 Tagen.

  1. Gemini 4 Argon High (Google) übernimmt Platz 1 bei Text Arena
  2. Claude Opus 5.5 High (Anthropic) übernimmt Platz 1 bei Text Arena
  3. Claude Opus 5.5 Max (Anthropic) übernimmt Platz 1 bei Code Arena
  4. Claude Fable 5 High (Anthropic) übernimmt Platz 1 bei Text Arena
  5. GPT-6 Astra Max (OpenAI) übernimmt Platz 1 bei Code Arena
  6. Claude Fable 5.1 Max (Anthropic) übernimmt Platz 1 bei Code Arena
  7. Claude Opus 5 Max (Anthropic) übernimmt Platz 1 bei Code Arena
  8. Kimi K3 (Moonshot AI) übernimmt Platz 1 bei Code Arena
  9. GPT-5.6 Sol xHigh (codex-harness) (OpenAI) übernimmt Platz 1 bei Code Arena (vorher #2)

Rangänderungen, Tag für Tag

Die letzten 30 Tage. Ein Aufstieg zählt, wenn ein Modell in einer Top 10 ein anderes überholt und sich sein Rang ändert. Modelle, die zurückfallen, werden gezählt, nicht einzeln aufgeführt.

  • GPT-6.1 Sol Max (OpenAI): Text Arena neu auf #21
  • Claude Sonnet 5.5 xHigh (Anthropic): Text Arena neu auf #45
  • Step 5 Preview (Stepfun): Text Arena neu auf #74
  • Gemini 3.8 Flash High (Google): Text Arena steigt von #11 auf #8
  • 3 Modelle rutschen nach unten

  • Claude Sonnet 5.5 xHigh (Anthropic): Code Arena neu auf #3

  • Claude Opus 5.5 High (Anthropic): übernimmt Platz 1 bei Text Arena
  • MiMo V2.6 Pro (Xiaomi): Text Arena neu auf #23
  • DeepSeek V4.1 Flash Max (DeepSeek): Text Arena neu auf #29
  • GPT-6 Sol Max (OpenAI): Text Arena neu auf #60
  • MiMo V2.6 Flash (Xiaomi): Text Arena neu auf #71
  • GPT-6 Luna Max (OpenAI): Text Arena neu auf #86
  • Grok 4.7 xHigh (SpaceXAI): Text Arena neu auf #92
  • 2 Modelle rutschen nach unten

  • Step 5 Preview High (Stepfun): Code Arena neu auf #29

  • Claude Opus 5.5 Max (Anthropic): übernimmt Platz 1 bei Code Arena
  • MiMo V2.6 Pro (Xiaomi): Code Arena neu auf #19
  • GPT-6 Luna Max (OpenAI): Code Arena neu auf #24
  • 1 Modell rutscht nach unten

  • GPT-6 Sol Max (OpenAI): Code Arena neu auf #4
  • 2 Modelle rutschen nach unten

  • Grok 4.7 xHigh (SpaceXAI): Code Arena neu auf #10
  • Qwen 3.8 Max (Alibaba): Code Arena steigt von #6 auf #4
  • Claude Opus 5 High (Anthropic): Code Arena steigt von #7 auf #6
  • 3 Modelle rutschen nach unten

  • Muse Spark 1.2 (xHigh) (Meta): Text Arena steigt von #5 auf #4
  • Claude Opus 4.7 (Anthropic): Text Arena steigt von #8 auf #7
  • Gemini 3.8 Flash High (Google): Text Arena steigt von #11 auf #9
  • 3 Modelle rutschen nach unten

  • DeepSeek V4.1 Flash Max (DeepSeek): Code Arena neu auf #16
  • GPT-6 Astra Max (OpenAI): Text Arena neu auf #24
  • Claude Opus 4.7 High (Anthropic): Text Arena steigt von #4 auf #3
  • Muse Spark 1.1 (Meta): Text Arena steigt von #10 auf #8
  • 2 Modelle rutschen nach unten

  • Muse Spark 1.3 Max (Meta): Code Arena neu auf #8
  • 2 Modelle rutschen nach unten

  • GPT-6 Astra Max (OpenAI): übernimmt Platz 1 bei Code Arena
  • Muse Spark 1.3 (xHigh) (Meta): Code Arena neu auf #11
  • Claude Fable 5 (Anthropic): Code Arena steigt von #8 auf #7
  • Qwen 3.8 Flash Next (Alibaba): Code Arena steigt von #10 auf #9
  • 4 Modelle rutschen nach unten

Älteste erfasste Änderung: 09.04.2026.

Sie brauchen ein Modell für Ihren konkreten Fall?

Benchmarks bewerten Modelle anhand fremder Aufgaben. Für einen Geschäftsprozess teste ich die engere Wahl mit Ihren eigenen Daten, Kosten und Datenschutzvorgaben und empfehle eines.

KI-Beratung