Coding Ranking
See which AI models perform best on Coding, which ones stay reliable, and where the biggest gaps appear. Sort by: Metric ↑.
404/404
Filter models
No models match the current search and filters.
| Rank | Model | Company | Coding Score | Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #50 | Qwen3.8 MAX low | Qwen | 0.8 | 0.9 | $1.089 | 2/3 | 28.7s |
| #54 | Muse Spark 1.2 low | Meta | 0.8 | 0.9 | $0.881 | 2/3 | 10.1s |
| #97 | Nemotron 3 Ultra medium | NVIDIA | 0.8 | 0.8 | $0.674 | 2/3 | 26.5s |
| #104 | Claude Fable 5.1 high | Anthropic | 0.8 | 0.8 | $3.471 | 2/3 | 13.9s |
| #105 | GPT-5.4 Mini medium | OpenAI | 0.8 | 0.8 | $1.102 | 2/3 | 57.9s |
| #137 | Grok 4.7 low | X AI | 0.8 | 0.7 | $1.933 | 2/3 | 189.1s |
| #162 | MiMo-V2.6-Flash low | Xiaomi | 0.8 | 0.7 | $0.200 | 2/3 | 11.0s |
| #123 | Muse Glimmer 30B medium | Meta | 0.8 | 0.8 | $0.288 | 2/3 | 33.7s |
| #140 | Inkling medium | Thinkingmachines | 0.8 | 0.7 | $0.527 | 2/3 | 25.2s |
| #75 | Inkling high | Thinkingmachines | 0.9 | 0.8 | $1.238 | 2/3 | 148.4s |
| #15 | Gemini 3 Flash Preview medium | 0.9 | 1.0 | $0.876 | 2/3 | 84.4s | |
| #30 | GPT-5.5 medium | OpenAI | 0.9 | 0.9 | $4.809 | 2/3 | 59.8s |
| #51 | GPT-5.4 medium | OpenAI | 0.9 | 0.9 | $2.213 | 2/3 | 44.4s |
| #113 | Step 3.7 Flash medium | Stepfun | 0.9 | 0.8 | $0.571 | 2/3 | 27.4s |
| #119 | Muse Glimmer 30B high | Meta | 0.9 | 0.8 | $0.506 | 2/3 | 96.0s |