P
PiazBench
Back to home

Speed

How fast can each AI model generate output? Ranked by tokens per second throughput.

RankModelScore
1
C
Celeris 1celeris/celeris-1
2148.9 t/s
2
I
Mercury 2inception/mercury-2
1070.1 t/s
3
Meta
Muse Sparkmeta/muse-spark-1-3
385.7 t/s
4
M
HyperNova 60B 2605multiversecomputing/hypernova-60b
375.2 t/s
5
A
Trinity Largearcee/trinity-large-thinking
356.7 t/s
6
Google
Gemini 3.5 Flash Litegoogle/gemini-3-5-flash-lite
356.1 t/s
7
Google
Gemini 3.7 Flashgoogle/gemini-3-7-flash-medium
347.8 t/s
8
Google
Gemini 3.8 Flashgoogle/gemini-3-8-flash
338.3 t/s
9
I
Ling 3.0 Flashinclusionai/ling-3-0-flash
325.7 t/s
10
NVIDIA
Nemotron 3.5 Lightningnvidia/nemotron-3-5-lightning
292.1 t/s
11
Amazon
Nova Microaws/nova-micro
285.7 t/s
12
Google
Gemini 3.5 Flashgoogle/gemini-3-5-flash-medium
280.1 t/s
13
OpenAI
gpt oss 20bopenai/gpt-oss-20b-low
268.3 t/s
14
NVIDIA
NVIDIA Nemotron 3 Nano 30B A3Bnvidia/nvidia-nemotron-3-nano-30b-a3b-reasoning
265.9 t/s
15
Alibaba
Qwen3.5 Omni Flashalibaba/qwen3-5-omni-flash
250.5 t/s
16
Meta
Muse Sparkmeta/muse-spark-1-2
250.1 t/s
17
Cohere
Command A+cohere/command-a-plus
245.8 t/s
18
DeepSeek
DeepSeek V4.1 Flashdeepseek/deepseek-v4-1-flash
237.3 t/s
19
DeepSeek
DeepSeek V4 Flash 0731deepseek/deepseek-v4-flash
233.8 t/s
20
S
Agnes 3.0 Flashagnes-ai/agnes-3-0-flash
228.4 t/s
21
DeepSeek
DeepSeek V4 Flash Visiondeepseek/deepseek-v4-flash-vision
228.4 t/s
22
Google
Gemini 3.6 Flashgoogle/gemini-3-6-flash
225.4 t/s
23
I
Granite 4.2 3Bibm/granite-4-2-3b
224.6 t/s
24
Amazon
Nova 2.0 Liteaws/nova-2-0-lite
222.6 t/s
25
M
Quasar 438Bmultiversecomputing/quasar-438b
219.4 t/s
26
Mistral
Ministral 3 3Bmistral/ministral-3-3b
218.1 t/s
27
L
LFM2.5 2.6Bliquidai/lfm2-5-2-6b
207.0 t/s
28
OpenAI
gpt oss 120bopenai/gpt-oss-120b-low
206.3 t/s
29
Alibaba
Qwen3 Next 80B A3Balibaba/qwen3-next-80b-a3b-reasoning
204.6 t/s
30
S
Agnes 2.5 Proagnes-ai/agnes-2-5-pro-alpha
202.3 t/s

439 models tested