Ranking de Benchmarks de LLM

Pontuações de inteligência, programação e agentic lado a lado, com custo-benefício por 1M tokens.

GrátisSem loginDados do OpenRouter

Dados de 2026-09-30103 modelos pontuadosArtificial Analysis

Posição
1

Claude Opus 5.5

Anthropic · Adaptive Reasoning, Max Effort, Default Fallback

57.6
2

Claude Sonnet 5.5

Anthropic · Adaptive Reasoning, Max Effort, Default Fallback

56.0
3

Claude Fable 5.1

Anthropic · Adaptive Reasoning, Max Effort, Default Fallback

53.4
4

Qwen3.8 Max

qwen

53.4
5

GPT-6 Astra

OpenAI · max

52.7
6

GPT-6.1 Sol

OpenAI · max

51.8
7

Claude Opus 5

Anthropic · Adaptive Reasoning, Max Effort

50.8
8

Claude Fable 5

Anthropic · Adaptive Reasoning, Max Effort, Opus 4.8 Fallback

49.6
9

GPT-6 Sol

OpenAI · max

47.5
10

GPT-5.6 Sol

OpenAI · max

47.0
11

Grok 4.7

SpaceXAI · xhigh

46.4
12

MiMo-V2.6-Pro

Xiaomi

46.3
13

Qwen3.8 Max

Qwen · 0902

45.4
14

GLM-5.3

Z.ai · max

44.8
15

Grok 4.6

SpaceXAI · high

44.3
16

Kimi K3

MoonshotAI · max

43.6
17

GPT-5.6 Terra

OpenAI · max

42.1
18

Claude Opus 4.8

Anthropic · Adaptive Reasoning, Max Effort

41.8
19

GLM 5.3 Flash

Z.ai

41.8
20

Gemini 3.8 Flash

Google · high

40.9
21

Qwen3.8 2.4T A95B

Qwen

39.9
22

Muse Spark 1.2

Meta · xhigh

39.6
23

DeepSeek V4.1 Flash

DeepSeek · Reasoning, Max Effort

39.5
24

Gemini 3.7 Flash

Google · high

39.1
25

Grok 4.5

SpaceXAI · high

38.8
26

GPT-5.5

OpenAI · xhigh

38.4
27

Claude Sonnet 5

Anthropic · Adaptive Reasoning, Max Effort

38.2
28

MiMo-V2.6-Flash

Xiaomi

37.9
29

GPT-6 Luna

OpenAI · max

37.3
30

GPT-5.6 Luna

OpenAI · max

37.3
31

DeepSeek V4 Pro 0813

DeepSeek · Reasoning, Max Effort

36.0
32

DeepSeek V4 Flash 0731

DeepSeek · Reasoning, Max Effort

34.3
33

Gemini 3.6 Flash

Google · high

34.0
34

GLM-5.2

Z.ai · max

33.7
35

Muse Spark 1.1

Meta · xhigh

33.7
36

Qwen3.8 27B

Qwen · xhigh

33.7
37

Gemini 3.5 Flash

Google · high

32.6
38

DeepSeek V4 Pro 0424

DeepSeek · Reasoning, Max Effort

30.4
39

Claude Sonnet 4.6

Anthropic · Adaptive Reasoning, Max Effort

30.1
40

Gemini 3.1 Pro Preview

Google

29.7
41

Qwen3.7 Max

Qwen

29.5
42

MiniMax-M3

MiniMax

29.2
43

Kimi K2.6

MoonshotAI

27.0
44

GLM-5.1

Z.ai · Reasoning

26.1
45

MiMo-V2.5-Pro

Xiaomi

26.0
46

Kimi K2.7 Code

MoonshotAI

25.8
47

Hy3

Tencent

25.3
48

Qwen3.7 Plus

Qwen

25.2
49

Inkling

Thinking Machines · xhigh

25.0
50

Grok 4.3

SpaceXAI · high

24.9

Custo-benefício = pontuação ÷ preço misto por 1M tokens. Maior é melhor.

Pontuações de inteligência, programação e agentic lado a lado, com custo-benefício por 1M tokens.

As pontuações vêm da Artificial Analysis, servidas pelo OpenRouter, em três índices independentes: inteligência para raciocínio e conhecimento gerais, programação para tarefas reais de codificação, e agentic para uso de ferramentas em várias etapas e execução autônoma. Eles discordam com frequência — o modelo mais inteligente nem sempre é o melhor programador, e pontuações agentic fortes frequentemente vêm acompanhadas de um preço equivalente. Colocar os três ao lado da coluna de preços é o que transforma “devíamos trocar?” em uma decisão com evidências por trás.

Como usar

  1. 1Alterne o benchmark (inteligência / programação / agentic) e o quadro reordena por essa pontuação.
  2. 2Ordene por custo-benefício para ver quantos pontos cada dólar por 1M tokens compra.
  3. 3Leia na coluna de preço para encontrar a melhor pontuação dentro do seu orçamento.

FAQ