/ LLM-Benchmarks / Instruction Following
Instruction Following Benchmark: welches Modell sich an Vorgaben hält
Einhaltung von Formatvorgaben und komplexen Anweisungen, aus LiveBench.
DatenLiveBenchRelease 2026-06-25abgerufen
LiveBench Instruction Following · CC BY-SA 4.0
Originalquelle ansehen| # | Modell | Wertung | Kosten pro gelöster Aufgabe |
|---|---|---|---|
| 1 | Gemini 3.8 Flash HighGoogle | 81.4% | $0.31 |
| 2 | Gemini 3.7 Flash HighGoogle | 79.9% | $0.16 |
| 3 | Gemini 3.1 Pro Preview HighGoogle | 79.1% | $0.29 |
| 4 | Muse Spark 1.3 xHigh EffortMeta | 78.0% | $0.22 |
| 5 | Qwen 3.8 Flash NextAlibaba · Open Weights | 77.1% | $0.042 |
| 6 | Claude Fable 5 Max EffortAnthropic | 75.8% | $1.44 |
| 7 | GPT-6 Astra Max EffortOpenAI | 75.6% | $0.74 |
| 8 | Gemini 3.5 Flash HighGoogle | 75.6% | $0.25 |
| 9 | Gemini 3.6 Flash HighGoogle | 75.4% | $0.23 |
| 10 | Grok 4.7 xHighxAI | 75.3% | $0.72 |
| 11 | Muse Spark 1.2 xHigh EffortMeta | 74.3% | $0.38 |
| 12 | GPT-6.1 Sol Max EffortOpenAI | 74.2% | $0.14 |
| 13 | Qwen 3.8 MaxAlibaba · Open Weights | 74.1% | $0.28 |
| 14 | Qwen 3.7 MaxAlibaba | 74.0% | $0.18 |
| 15 | Nemotron 3 Ultra 550B A55BNVIDIA · Open Weights | 73.4% | $0.37 |
| 16 | Claude Fable 5.1 Max EffortAnthropic | 73.0% | $1.21 |
| 17 | Qwen3.8 27BAlibaba · Open Weights | 72.7% | $0.094 |
| 18 | Claude 4.8 Opus Thinking Max EffortAnthropic | 72.0% | $0.98 |
| 19 | Grok 4.6 xHighxAI | 71.9% | $0.21 |
| 20 | GPT-5.6 Sol Max EffortOpenAI | 71.8% | $0.52 |
| 21 | Grok 4.5xAI | 71.5% | $0.13 |
| 22 | Kimi K3Moonshot AI · Open Weights | 71.4% | $0.35 |
| 23 | DeepSeek V4 Flash Vision ExpDeepSeek · Open Weights | 71.0% | $0.051 |
| 24 | GPT-5.5 Thinking xHigh EffortOpenAI | 70.7% | $0.43 |
| 25 | Claude Sonnet 5.5 xHigh EffortAnthropic | 70.5% | $0.14 |
| 26 | GPT-5.4 Thinking xHigh EffortOpenAI | 70.2% | $0.39 |
| 27 | Inkling xHigh EffortThinking Machines · Open Weights | 70.1% | $0.31 |
| 28 | DeepSeek V4.1 Flash Max EffortDeepSeek · Open Weights | 70.0% | $0.029 |
| 29 | Muse Spark 1.1 xHigh EffortMeta | 69.6% | $0.20 |
| 30 | GLM-5.3Z.AI · Open Weights | 69.3% | $0.45 |
| 31 | GPT-6 Sol Max EffortOpenAI | 68.6% | $0.27 |
| 32 | DeepSeek V4 Pro 0813DeepSeek · Open Weights | 67.7% | $0.044 |
| 33 | GPT-5.4 Nano xHighOpenAI | 67.2% | $0.091 |
| 34 | Gemini 3.5 Flash-Lite HighGoogle | 67.2% | $0.069 |
| 35 | Claude 4.7 Opus Thinking xHigh EffortAnthropic | 66.7% | $0.53 |
| 36 | GPT-5.2 CodexOpenAI | 66.4% | $0.19 |
| 37 | Claude 5.5 Opus Thinking Max EffortAnthropic | 65.7% | $0.80 |
| 38 | DeepSeek V4 Flash 0731DeepSeek · Open Weights | 65.5% | $0.060 |
| 39 | Grok Build 0.1xAI | 65.2% | $0.024 |
| 40 | GPT-5.6 Terra Max EffortOpenAI | 64.6% | $0.35 |
| 41 | Kimi K2.6 ThinkingMoonshot AI · Open Weights | 64.4% | $0.17 |
| 42 | Claude Sonnet 5 xHigh EffortAnthropic | 63.9% | $0.51 |
| 43 | Claude 5 Opus Thinking Max EffortAnthropic | 63.8% | $0.70 |
| 44 | Claude 4.6 Opus Thinking High EffortAnthropic | 63.3% | $0.40 |
| 45 | Claude 4.6 Sonnet Thinking Medium EffortAnthropic | 63.2% | $0.31 |
| 46 | Grok 4.3xAI | 62.8% | $0.061 |
| 47 | Claude 4.5 Opus Thinking High EffortAnthropic | 62.5% | $0.61 |
| 48 | GLM-5.2Z.AI · Open Weights | 62.3% | $0.23 |
| 49 | GPT-5.2 HighOpenAI | 61.8% | $0.23 |
| 50 | Ox Alpha MaxStealth | 60.3% | – |
| 51 | GPT-5.6 Luna Max EffortOpenAI | 60.1% | $0.17 |
| 52 | GPT-5.4 Mini xHighOpenAI | 59.8% | $0.33 |
| 53 | Qwen 3.6 PlusAlibaba | 58.3% | $0.23 |
| 54 | Minimax M3MiniMax | 57.5% | $0.060 |
| 55 | Kimi K2.7 CodeMoonshot AI · Open Weights | 56.3% | $0.10 |
| 56 | GPT-6 Luna Max EffortOpenAI | 55.9% | $0.026 |
| 57 | Qwen 3.6 27BAlibaba · Open Weights | 53.2% | $0.20 |
| 58 | GLM-5.3 FlashZ.AI · Open Weights | 52.8% | $0.031 |
Sie brauchen ein Modell für Ihren konkreten Fall?
Benchmarks bewerten Modelle anhand fremder Aufgaben. Für einen Geschäftsprozess teste ich die engere Wahl mit Ihren eigenen Daten, Kosten und Datenschutzvorgaben und empfehle eines.