Back to home
Speed
How fast can each AI model generate output? Ranked by tokens per second throughput.
RankModelScore
123
456
7
8
910
11
12
13
14
15
16
17
18
19
2021
22
2324
2526
2728
29
30
C
Celeris 1celeris/celeris-1
2148.9 t/s
I
Mercury 2inception/mercury-2
1070.1 t/s
Muse Sparkmeta/muse-spark-1-3
385.7 t/s
M
HyperNova 60B 2605multiversecomputing/hypernova-60b
375.2 t/s
A
Trinity Largearcee/trinity-large-thinking
356.7 t/s
Gemini 3.5 Flash Litegoogle/gemini-3-5-flash-lite
356.1 t/s
Gemini 3.7 Flashgoogle/gemini-3-7-flash-medium
347.8 t/s
Gemini 3.8 Flashgoogle/gemini-3-8-flash
338.3 t/s
I
Ling 3.0 Flashinclusionai/ling-3-0-flash
325.7 t/s
Nemotron 3.5 Lightningnvidia/nemotron-3-5-lightning
292.1 t/s
Nova Microaws/nova-micro
285.7 t/s
Gemini 3.5 Flashgoogle/gemini-3-5-flash-medium
280.1 t/s
gpt oss 20bopenai/gpt-oss-20b-low
268.3 t/s
NVIDIA Nemotron 3 Nano 30B A3Bnvidia/nvidia-nemotron-3-nano-30b-a3b-reasoning
265.9 t/s
Qwen3.5 Omni Flashalibaba/qwen3-5-omni-flash
250.5 t/s
Muse Sparkmeta/muse-spark-1-2
250.1 t/s
Command A+cohere/command-a-plus
245.8 t/s
DeepSeek V4.1 Flashdeepseek/deepseek-v4-1-flash
237.3 t/s
DeepSeek V4 Flash 0731deepseek/deepseek-v4-flash
233.8 t/s
S
Agnes 3.0 Flashagnes-ai/agnes-3-0-flash
228.4 t/s
DeepSeek V4 Flash Visiondeepseek/deepseek-v4-flash-vision
228.4 t/s
Gemini 3.6 Flashgoogle/gemini-3-6-flash
225.4 t/s
I
Granite 4.2 3Bibm/granite-4-2-3b
224.6 t/s
Nova 2.0 Liteaws/nova-2-0-lite
222.6 t/s
M
Quasar 438Bmultiversecomputing/quasar-438b
219.4 t/s
Ministral 3 3Bmistral/ministral-3-3b
218.1 t/s
L
LFM2.5 2.6Bliquidai/lfm2-5-2-6b
207.0 t/s
gpt oss 120bopenai/gpt-oss-120b-low
206.3 t/s
Qwen3 Next 80B A3Balibaba/qwen3-next-80b-a3b-reasoning
204.6 t/s
S
Agnes 2.5 Proagnes-ai/agnes-2-5-pro-alpha
202.3 t/s
439 models tested