Tabla de benchmarks LLM

Puntuaciones de inteligencia, programación y agente lado a lado, con valor por 1M tokens.

GratisSin iniciar sesiónDatos de OpenRouter

Datos del 2026-09-30103 modelos puntuadosArtificial Analysis

Puesto
1

Claude Opus 5.5

Anthropic · Adaptive Reasoning, Max Effort, Default Fallback

57.6
2

Claude Sonnet 5.5

Anthropic · Adaptive Reasoning, Max Effort, Default Fallback

56.0
3

Claude Fable 5.1

Anthropic · Adaptive Reasoning, Max Effort, Default Fallback

53.4
4

Qwen3.8 Max

qwen

53.4
5

GPT-6 Astra

OpenAI · max

52.7
6

GPT-6.1 Sol

OpenAI · max

51.8
7

Claude Opus 5

Anthropic · Adaptive Reasoning, Max Effort

50.8
8

Claude Fable 5

Anthropic · Adaptive Reasoning, Max Effort, Opus 4.8 Fallback

49.6
9

GPT-6 Sol

OpenAI · max

47.5
10

GPT-5.6 Sol

OpenAI · max

47.0
11

Grok 4.7

SpaceXAI · xhigh

46.4
12

MiMo-V2.6-Pro

Xiaomi

46.3
13

Qwen3.8 Max

Qwen · 0902

45.4
14

GLM-5.3

Z.ai · max

44.8
15

Grok 4.6

SpaceXAI · high

44.3
16

Kimi K3

MoonshotAI · max

43.6
17

GPT-5.6 Terra

OpenAI · max

42.1
18

Claude Opus 4.8

Anthropic · Adaptive Reasoning, Max Effort

41.8
19

GLM 5.3 Flash

Z.ai

41.8
20

Gemini 3.8 Flash

Google · high

40.9
21

Qwen3.8 2.4T A95B

Qwen

39.9
22

Muse Spark 1.2

Meta · xhigh

39.6
23

DeepSeek V4.1 Flash

DeepSeek · Reasoning, Max Effort

39.5
24

Gemini 3.7 Flash

Google · high

39.1
25

Grok 4.5

SpaceXAI · high

38.8
26

GPT-5.5

OpenAI · xhigh

38.4
27

Claude Sonnet 5

Anthropic · Adaptive Reasoning, Max Effort

38.2
28

MiMo-V2.6-Flash

Xiaomi

37.9
29

GPT-6 Luna

OpenAI · max

37.3
30

GPT-5.6 Luna

OpenAI · max

37.3
31

DeepSeek V4 Pro 0813

DeepSeek · Reasoning, Max Effort

36.0
32

DeepSeek V4 Flash 0731

DeepSeek · Reasoning, Max Effort

34.3
33

Gemini 3.6 Flash

Google · high

34.0
34

GLM-5.2

Z.ai · max

33.7
35

Muse Spark 1.1

Meta · xhigh

33.7
36

Qwen3.8 27B

Qwen · xhigh

33.7
37

Gemini 3.5 Flash

Google · high

32.6
38

DeepSeek V4 Pro 0424

DeepSeek · Reasoning, Max Effort

30.4
39

Claude Sonnet 4.6

Anthropic · Adaptive Reasoning, Max Effort

30.1
40

Gemini 3.1 Pro Preview

Google

29.7
41

Qwen3.7 Max

Qwen

29.5
42

MiniMax-M3

MiniMax

29.2
43

Kimi K2.6

MoonshotAI

27.0
44

GLM-5.1

Z.ai · Reasoning

26.1
45

MiMo-V2.5-Pro

Xiaomi

26.0
46

Kimi K2.7 Code

MoonshotAI

25.8
47

Hy3

Tencent

25.3
48

Qwen3.7 Plus

Qwen

25.2
49

Inkling

Thinking Machines · xhigh

25.0
50

Grok 4.3

SpaceXAI · high

24.9

Valor = puntuación ÷ precio combinado por 1M tokens. Cuanto mayor, mejor.

Puntuaciones de inteligencia, programación y agente lado a lado, con valor por 1M tokens.

Las puntuaciones provienen de Artificial Analysis, servidas a través de OpenRouter, en tres índices independientes: inteligencia para razonamiento y conocimiento general, programación para tareas reales de código, y agente para el uso de herramientas en varios pasos y la ejecución autónoma. Suelen discrepar a menudo — el modelo más inteligente no siempre es el mejor programando, y unas puntuaciones de agente fuertes suelen traer un precio acorde. Poner las tres junto a la columna de precios es lo que convierte «¿deberíamos cambiar?» en una decisión con evidencias detrás.

Cómo usar

  1. 1Cambia el benchmark (inteligencia / programación / agente) y la tabla se reclasifica por esa puntuación.
  2. 2Ordena por valor para ver cuántos puntos compra cada dólar por 1M tokens.
  3. 3Lee hacia la columna de precios para encontrar la mejor puntuación dentro de tu presupuesto.

Preguntas frecuentes