LLM ベンチマークランキング

知能・コーディング・エージェント能力を横並びで、100万トークンあたりのコスパ付き。

無料ログイン不要データ提供:OpenRouter

データ基準日 2026-09-30103 件のモデルがスコア対象Artificial Analysis

順位
1

Claude Opus 5.5

Anthropic · Adaptive Reasoning, Max Effort, Default Fallback

57.6
2

Claude Sonnet 5.5

Anthropic · Adaptive Reasoning, Max Effort, Default Fallback

56.0
3

Claude Fable 5.1

Anthropic · Adaptive Reasoning, Max Effort, Default Fallback

53.4
4

Qwen3.8 Max

qwen

53.4
5

GPT-6 Astra

OpenAI · max

52.7
6

GPT-6.1 Sol

OpenAI · max

51.8
7

Claude Opus 5

Anthropic · Adaptive Reasoning, Max Effort

50.8
8

Claude Fable 5

Anthropic · Adaptive Reasoning, Max Effort, Opus 4.8 Fallback

49.6
9

GPT-6 Sol

OpenAI · max

47.5
10

GPT-5.6 Sol

OpenAI · max

47.0
11

Grok 4.7

SpaceXAI · xhigh

46.4
12

MiMo-V2.6-Pro

Xiaomi

46.3
13

Qwen3.8 Max

Qwen · 0902

45.4
14

GLM-5.3

Z.ai · max

44.8
15

Grok 4.6

SpaceXAI · high

44.3
16

Kimi K3

MoonshotAI · max

43.6
17

GPT-5.6 Terra

OpenAI · max

42.1
18

Claude Opus 4.8

Anthropic · Adaptive Reasoning, Max Effort

41.8
19

GLM 5.3 Flash

Z.ai

41.8
20

Gemini 3.8 Flash

Google · high

40.9
21

Qwen3.8 2.4T A95B

Qwen

39.9
22

Muse Spark 1.2

Meta · xhigh

39.6
23

DeepSeek V4.1 Flash

DeepSeek · Reasoning, Max Effort

39.5
24

Gemini 3.7 Flash

Google · high

39.1
25

Grok 4.5

SpaceXAI · high

38.8
26

GPT-5.5

OpenAI · xhigh

38.4
27

Claude Sonnet 5

Anthropic · Adaptive Reasoning, Max Effort

38.2
28

MiMo-V2.6-Flash

Xiaomi

37.9
29

GPT-6 Luna

OpenAI · max

37.3
30

GPT-5.6 Luna

OpenAI · max

37.3
31

DeepSeek V4 Pro 0813

DeepSeek · Reasoning, Max Effort

36.0
32

DeepSeek V4 Flash 0731

DeepSeek · Reasoning, Max Effort

34.3
33

Gemini 3.6 Flash

Google · high

34.0
34

GLM-5.2

Z.ai · max

33.7
35

Muse Spark 1.1

Meta · xhigh

33.7
36

Qwen3.8 27B

Qwen · xhigh

33.7
37

Gemini 3.5 Flash

Google · high

32.6
38

DeepSeek V4 Pro 0424

DeepSeek · Reasoning, Max Effort

30.4
39

Claude Sonnet 4.6

Anthropic · Adaptive Reasoning, Max Effort

30.1
40

Gemini 3.1 Pro Preview

Google

29.7
41

Qwen3.7 Max

Qwen

29.5
42

MiniMax-M3

MiniMax

29.2
43

Kimi K2.6

MoonshotAI

27.0
44

GLM-5.1

Z.ai · Reasoning

26.1
45

MiMo-V2.5-Pro

Xiaomi

26.0
46

Kimi K2.7 Code

MoonshotAI

25.8
47

Hy3

Tencent

25.3
48

Qwen3.7 Plus

Qwen

25.2
49

Inkling

Thinking Machines · xhigh

25.0
50

Grok 4.3

SpaceXAI · high

24.9

コスパ = スコア ÷ ブレンド単価(100万トークンあたり)。高いほどお得です。

知能・コーディング・エージェント能力を横並びで、100万トークンあたりのコスパ付き。

スコアは Artificial Analysis から、OpenRouter を通じて提供されます。3 つの独立した指数からなります。知能は汎用的な推論と知識、コーディングは実際のプログラミング課題、エージェント能力は複数ステップのツール利用と自律実行です。これらはよく食い違います——最も知能の高いモデルが必ずしも最良のコーダーとは限らず、高いエージェント能力にはそれに見合う価格がつくことも少なくありません。3 つを価格列と並べることで、「乗り換えるべきか」が証拠に基づく判断になります。

使い方

  1. 1ベンチマーク(知能 / コーディング / エージェント)を切り替えると、そのスコア順に並べ替わります。
  2. 2コスパ順に並べると、100万トークンあたりの単価で何ポイント買えるかがわかります。
  3. 3価格列と横に読むと、予算内で最も高いスコアのモデルが見つかります。

よくある質問