P
PiazBench
Back to home

Coding

How well can each AI model write, debug, and refactor code? Ranked by Artificial Analysis Coding Index.

RankModelScore
1
Anthropic
Claude Fable 5.1anthropic/claude-fable-5-1
81.6
2
OpenAI
GPT-5openai/gpt-5-6-sol-xhigh
78.3
3
Anthropic
Claude Opus 5anthropic/claude-opus-5
78.0
4
OpenAI
GPT 6 Astraopenai/gpt-6-astra-high
77.1
5
S
Grok 4xai/grok-4-6
76.8
6
OpenAI
GPT-5openai/gpt-5-6-terra
76.7
7
Meta
Muse Sparkmeta/muse-spark-1-3-xhigh
76.5
8
Anthropic
Claude Fable 5anthropic/claude-fable-5
76.5
9
Google
Gemini 3.8 Flashgoogle/gemini-3-8-flash
76.3
10
K
Kimi K3kimi/kimi-k3
76.2
11
Google
Gemini 3.7 Flashgoogle/gemini-3-7-flash
76.1
12
OpenAI
GPT-5openai/gpt-5-5
74.9
13
Z
GLM 5.3zai/glm-5-3
74.8
14
Anthropic
Claude Opus 4.8anthropic/claude-opus-4-8
74.3
15
Anthropic
Claude Opus 4.7anthropic/claude-opus-4-7
73.6
16
Alibaba
Qwen3.8 Flash Nextalibaba/qwen3-8-flash-next
73.1
17
S
Grok 4xai/grok-4-5
72.4
18
Meta
Muse Sparkmeta/muse-spark-1-2
72.2
19
Alibaba
Qwen3.8 2.4T A95Balibaba/qwen3-8-2-4t-a95b
71.9
20
Alibaba
Qwen3.8 Maxalibaba/qwen3-8-max
71.8
21
Z
GLM 5.3 Flashzai/glm-5-3-flash
71.5
22
Anthropic
Claude Sonnet 5anthropic/claude-sonnet-5
71.5
23
OpenAI
GPT-5openai/gpt-5-6-luna
71.4
24
Meta
Muse Sparkmeta/muse-spark-1-1
71.3
25
OpenAI
GPT-5openai/gpt-5-4
71.1
26
Google
Gemini 3.5 Flashgoogle/gemini-3-5-flash
70.1
27
Google
Gemini 3.6 Flashgoogle/gemini-3-6-flash
69.2
28
DeepSeek
DeepSeek V4 Flash 0731deepseek/deepseek-v4-flash
69.1
29
Google
Gemini 3.1 Progoogle/gemini-3-1-pro-preview
68.8
30
DeepSeek
DeepSeek V4 Pro 0813deepseek/deepseek-v4-pro
68.8

188 models tested