Coding Ranking
See which AI models perform best on Coding, which ones stay reliable, and where the biggest gaps appear. Sort by: Metric ↑.
404/404
Filter models
No models match the current search and filters.
| Rank | Model | Company | Coding Score | Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #261 | Claude Sonnet 5 none | Anthropic | 0.5 | 0.6 | $1.095 | 0/3 | 3.67s |
| #318 | Dots 3 Note Preview default | Dots Studio | 0.5 | 0.5 | $0.000 | 0/3 | 6.12s |
| #323 | Qwen3 Coder Next default | Qwen | 0.5 | 0.5 | $0.067 | 0/3 | 2.22s |
| #303 | Inkling Small low | Thinkingmachines | 0.5 | 0.5 | $0.055 | 0/3 | 3.70s |
| #340 | GPT-5.4 Nano none | OpenAI | 0.5 | 0.5 | $0.068 | 0/3 | 2.22s |
| #128 | GLM 5.1 medium | Z.ai | 0.5 | 0.8 | $1.546 | 0/3 | 109.6s |
| #272 | Mistral Large 4 none | Mistral | 0.5 | 0.6 | $0.290 | 0/3 | 85.0s |
| #333 | Mercury 2.5 Preview default | Inception | 0.5 | 0.5 | $0.023 | 0/3 | 459ms |
| #395 | Decider V1.1 27B default | Perplexity | 0.5 | 0.3 | $0.002 | 1/2 | 305ms |
| #133 | Qwen3.6 Flash medium | Qwen | 0.5 | 0.7 | $0.783 | 0/3 | 42.9s |
| #218 | Mercury 2.5 medium | Inception | 0.5 | 0.6 | $0.034 | 0/3 | 3.70s |
| #246 | Apodex 1.1 Mini low | Apodex | 0.5 | 0.6 | $0.000 | 0/3 | 48.8s |
| #181 | Inkling low | Thinkingmachines | 0.5 | 0.7 | $0.293 | 0/3 | 8.71s |
| #192 | Ember-1 max | Fireworks | 0.5 | 0.7 | $3.264 | 1/3 | 105.1s |
| #292 | Hy4 preview low | Tencent | 0.5 | 0.5 | $1.844 | 0/3 | 219.1s |