LLM-Benchmark-Board

Intelligenz-, Coding- und Agentic-Scores nebeneinander, mit Wert pro 1M Tokens.

KostenlosOhne LoginDaten von OpenRouter

Daten vom 2026-09-30103 Modelle bewertetArtificial Analysis

Rang
1

Claude Opus 5.5

Anthropic · Adaptive Reasoning, Max Effort, Default Fallback

57.6
2

Claude Sonnet 5.5

Anthropic · Adaptive Reasoning, Max Effort, Default Fallback

56.0
3

Claude Fable 5.1

Anthropic · Adaptive Reasoning, Max Effort, Default Fallback

53.4
4

Qwen3.8 Max

qwen

53.4
5

GPT-6 Astra

OpenAI · max

52.7
6

GPT-6.1 Sol

OpenAI · max

51.8
7

Claude Opus 5

Anthropic · Adaptive Reasoning, Max Effort

50.8
8

Claude Fable 5

Anthropic · Adaptive Reasoning, Max Effort, Opus 4.8 Fallback

49.6
9

GPT-6 Sol

OpenAI · max

47.5
10

GPT-5.6 Sol

OpenAI · max

47.0
11

Grok 4.7

SpaceXAI · xhigh

46.4
12

MiMo-V2.6-Pro

Xiaomi

46.3
13

Qwen3.8 Max

Qwen · 0902

45.4
14

GLM-5.3

Z.ai · max

44.8
15

Grok 4.6

SpaceXAI · high

44.3
16

Kimi K3

MoonshotAI · max

43.6
17

GPT-5.6 Terra

OpenAI · max

42.1
18

Claude Opus 4.8

Anthropic · Adaptive Reasoning, Max Effort

41.8
19

GLM 5.3 Flash

Z.ai

41.8
20

Gemini 3.8 Flash

Google · high

40.9
21

Qwen3.8 2.4T A95B

Qwen

39.9
22

Muse Spark 1.2

Meta · xhigh

39.6
23

DeepSeek V4.1 Flash

DeepSeek · Reasoning, Max Effort

39.5
24

Gemini 3.7 Flash

Google · high

39.1
25

Grok 4.5

SpaceXAI · high

38.8
26

GPT-5.5

OpenAI · xhigh

38.4
27

Claude Sonnet 5

Anthropic · Adaptive Reasoning, Max Effort

38.2
28

MiMo-V2.6-Flash

Xiaomi

37.9
29

GPT-6 Luna

OpenAI · max

37.3
30

GPT-5.6 Luna

OpenAI · max

37.3
31

DeepSeek V4 Pro 0813

DeepSeek · Reasoning, Max Effort

36.0
32

DeepSeek V4 Flash 0731

DeepSeek · Reasoning, Max Effort

34.3
33

Gemini 3.6 Flash

Google · high

34.0
34

GLM-5.2

Z.ai · max

33.7
35

Muse Spark 1.1

Meta · xhigh

33.7
36

Qwen3.8 27B

Qwen · xhigh

33.7
37

Gemini 3.5 Flash

Google · high

32.6
38

DeepSeek V4 Pro 0424

DeepSeek · Reasoning, Max Effort

30.4
39

Claude Sonnet 4.6

Anthropic · Adaptive Reasoning, Max Effort

30.1
40

Gemini 3.1 Pro Preview

Google

29.7
41

Qwen3.7 Max

Qwen

29.5
42

MiniMax-M3

MiniMax

29.2
43

Kimi K2.6

MoonshotAI

27.0
44

GLM-5.1

Z.ai · Reasoning

26.1
45

MiMo-V2.5-Pro

Xiaomi

26.0
46

Kimi K2.7 Code

MoonshotAI

25.8
47

Hy3

Tencent

25.3
48

Qwen3.7 Plus

Qwen

25.2
49

Inkling

Thinking Machines · xhigh

25.0
50

Grok 4.3

SpaceXAI · high

24.9

Wert = Score ÷ Blended-Preis pro 1M Tokens. Höher ist besser.

Intelligenz-, Coding- und Agentic-Scores nebeneinander, mit Wert pro 1M Tokens.

Die Scores stammen von Artificial Analysis, über OpenRouter bereitgestellt, über drei unabhängige Indizes: Intelligenz für allgemeines Reasoning und Wissen, Coding für echte Programmieraufgaben und Agentic für mehrstufige Tool-Nutzung und autonome Ausführung. Sie widersprechen sich oft — das intelligenteste Modell ist nicht immer der beste Coder, und starke Agentic-Scores gehen häufig mit einem passenden Preisschild einher. Alle drei neben die Preisspalte zu stellen, verwandelt die Frage „sollten wir wechseln?“ in eine Entscheidung mit Belegen.

Anleitung

  1. 1Wechsle den Benchmark (Intelligence / Coding / Agentic), und das Board ordnet nach diesem Score neu.
  2. 2Sortiere nach Wert, um zu sehen, wie viele Punkte jeder Dollar pro 1M Tokens kauft.
  3. 3Lies in die Preisspalte, um den besten Score innerhalb deines Budgets zu finden.

FAQ