大模型跑分榜

综合智能、代码、Agent 三项指数排名,同时算出每 1M Token 的性价比。

免费免登录数据来源 OpenRouter

数据截止 2026-09-30103 个模型有该项评分Artificial Analysis

排名
1

Claude Opus 5.5

Anthropic · Adaptive Reasoning, Max Effort, Default Fallback

57.6
2

Claude Sonnet 5.5

Anthropic · Adaptive Reasoning, Max Effort, Default Fallback

56.0
3

Claude Fable 5.1

Anthropic · Adaptive Reasoning, Max Effort, Default Fallback

53.4
4

Qwen3.8 Max

qwen

53.4
5

GPT-6 Astra

OpenAI · max

52.7
6

GPT-6.1 Sol

OpenAI · max

51.8
7

Claude Opus 5

Anthropic · Adaptive Reasoning, Max Effort

50.8
8

Claude Fable 5

Anthropic · Adaptive Reasoning, Max Effort, Opus 4.8 Fallback

49.6
9

GPT-6 Sol

OpenAI · max

47.5
10

GPT-5.6 Sol

OpenAI · max

47.0
11

Grok 4.7

SpaceXAI · xhigh

46.4
12

MiMo-V2.6-Pro

Xiaomi

46.3
13

Qwen3.8 Max

Qwen · 0902

45.4
14

GLM-5.3

Z.ai · max

44.8
15

Grok 4.6

SpaceXAI · high

44.3
16

Kimi K3

MoonshotAI · max

43.6
17

GPT-5.6 Terra

OpenAI · max

42.1
18

Claude Opus 4.8

Anthropic · Adaptive Reasoning, Max Effort

41.8
19

GLM 5.3 Flash

Z.ai

41.8
20

Gemini 3.8 Flash

Google · high

40.9
21

Qwen3.8 2.4T A95B

Qwen

39.9
22

Muse Spark 1.2

Meta · xhigh

39.6
23

DeepSeek V4.1 Flash

DeepSeek · Reasoning, Max Effort

39.5
24

Gemini 3.7 Flash

Google · high

39.1
25

Grok 4.5

SpaceXAI · high

38.8
26

GPT-5.5

OpenAI · xhigh

38.4
27

Claude Sonnet 5

Anthropic · Adaptive Reasoning, Max Effort

38.2
28

MiMo-V2.6-Flash

Xiaomi

37.9
29

GPT-6 Luna

OpenAI · max

37.3
30

GPT-5.6 Luna

OpenAI · max

37.3
31

DeepSeek V4 Pro 0813

DeepSeek · Reasoning, Max Effort

36.0
32

DeepSeek V4 Flash 0731

DeepSeek · Reasoning, Max Effort

34.3
33

Gemini 3.6 Flash

Google · high

34.0
34

GLM-5.2

Z.ai · max

33.7
35

Muse Spark 1.1

Meta · xhigh

33.7
36

Qwen3.8 27B

Qwen · xhigh

33.7
37

Gemini 3.5 Flash

Google · high

32.6
38

DeepSeek V4 Pro 0424

DeepSeek · Reasoning, Max Effort

30.4
39

Claude Sonnet 4.6

Anthropic · Adaptive Reasoning, Max Effort

30.1
40

Gemini 3.1 Pro Preview

Google

29.7
41

Qwen3.7 Max

Qwen

29.5
42

MiniMax-M3

MiniMax

29.2
43

Kimi K2.6

MoonshotAI

27.0
44

GLM-5.1

Z.ai · Reasoning

26.1
45

MiMo-V2.5-Pro

Xiaomi

26.0
46

Kimi K2.7 Code

MoonshotAI

25.8
47

Hy3

Tencent

25.3
48

Qwen3.7 Plus

Qwen

25.2
49

Inkling

Thinking Machines · xhigh

25.0
50

Grok 4.3

SpaceXAI · high

24.9

性价比 = 分数 ÷ 每百万 Token 混合价,越高越划算。

综合智能、代码、Agent 三项指数排名,同时算出每 1M Token 的性价比。

分数来自 Artificial Analysis(经由 OpenRouter 提供),包含三个相互独立的指数:综合智能衡量通用推理与知识,代码指数面向真实编程任务,Agent 指数评估多步工具调用与自主执行。三者口径不同,排名也常常打架——综合智能最高的模型未必最会写代码,Agent 能力强的模型也可能很贵。这张榜的价值就在于把三个维度并排放,再叠加价格列,让「值不值得换」这件事有据可依。

怎么用

  1. 1切换评测维度(综合智能 / 代码能力 / Agent 能力),榜单按该项分数重新排序。
  2. 2切到「性价比」排序,看每 1M Token 混合价能换到多少分。
  3. 3对照价格列,挑出在你的预算区间里分数最高的那一档。

常见问题