llm.ing

Median output speed

independentrun by Artificial Analysisunit: tokens_per_sDisplay with attribution; no redistributionobserved Jul 24, 202642 modelssource ↗
AA Intelligence IndexAA Coding IndexAA Agentic IndexMedian output speedMedian time to first token
#ModelScore
1Mercury 2
958 tok/s
2Gemini 3.5 Flash Lite
450 tok/s
3Gemini 2.5 Flash-Lite
240 tok/s
4Gemini 2.5 Flashthinking
231 tok/s
5o3-mini
220 tok/s
6GPT-5.1 Codex
196 tok/s
7Qwen3-Next 80B-A3B Instruct
183 tok/s
8Gemini 3.5 Flash
181 tok/s
9GPT-5.6 Luna
173 tok/s
10GPT-5.2 Codex
168 tok/s
11Qwen3.5 122B-A10Bnon-reasoning
145 tok/s
12Gemini 2.5 Pro
139 tok/s
13o3
136 tok/s
14Qwen3.5 35B-A3B
130 tok/s
15nvidia-nemotron-nano-9b-v2
116 tok/s
16GPT-4.1
115 tok/s
17Qwen Turbo
104 tok/s
18GLM-4.7-Flash
104 tok/s
19nemotron-3-nano-30b-a3b
103 tok/s
20MiniMax-M3
96 tok/s
21GPT-5
95 tok/s
22Grok Build 0.1
93 tok/s
23GPT-5 Mini
89 tok/s
24GPT-5.1
88 tok/s
25GPT-5.4non-reasoning
88 tok/s
26Qwen3.5 27Bnon-reasoning
83 tok/s
27MiniMax-M2.1
77 tok/s
28GPT-5.2
76 tok/s
29Claude Sonnet 5
74 tok/s
30MiniMax-M2.5
73 tok/s
31GPT-5.5
70 tok/s
32Qwen3.5 397B-A17B
64 tok/s
33GLM-4.5Vthinking
63 tok/s
34Qwen3-Coder 480B-A35B Instruct
59 tok/s
35MiniMax-M2.7
56 tok/s
36Qwen3.6 27Bnon-reasoning
55 tok/s
37Claude Opus 4.7non-reasoning
46 tok/s
38Claude Opus 4.5 (latest)thinking
46 tok/s
39GLM-5
46 tok/s
40GLM-4.6V
44 tok/s
41Claude Sonnet 4.6
44 tok/s
42Claude Opus 4.6
41 tok/s

Bars on a 0–1000 tokens_per_s scale. Scores link to model pages; every number keeps its source on the model page.