Coding Ranking
See which AI models perform best on Coding, which ones stay reliable, and where the biggest gaps appear. Sort by: Metric ↑.
404/404
Filter models
No models match the current search and filters.
| Rank | Model | Company | Coding Score | Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #48 | Muse Spark 1.1 medium | Meta | 1.0 | 0.9 | $1.665 | 3/3 | 15.7s |
| #49 | Claude Fable 5 medium | Anthropic | 1.0 | 0.9 | $5.089 | 3/3 | 15.6s |
| #52 | DeepSeek V4.1 Flash high | DeepSeek | 1.0 | 0.9 | $0.617 | 3/3 | 49.2s |
| #53 | DeepSeek V4.1 Flash medium | DeepSeek | 1.0 | 0.9 | $0.591 | 3/3 | 34.4s |
| #55 | GPT-5.2 medium | OpenAI | 1.0 | 0.9 | $1.558 | 3/3 | 22.7s |
| #60 | DeepSeek V4.1 Flash max | DeepSeek | 1.0 | 0.9 | $1.204 | 3/3 | 62.5s |
| #61 | Muse Spark 1.1 low | Meta | 1.0 | 0.9 | $0.885 | 3/3 | 10.3s |
| #63 | Claude Sonnet 5.5 high | Anthropic | 1.0 | 0.9 | $1.175 | 3/3 | 9.85s |
| #65 | Qwen3.8 Max (0902) low | Qwen | 1.0 | 0.9 | $1.131 | 3/3 | 37.4s |
| #66 | Grok 4.6 high | X AI | 1.0 | 0.9 | $2.629 | 3/3 | 102.2s |
| #69 | Qwen3.7 Max medium | Qwen | 1.0 | 0.9 | $1.689 | 3/3 | 35.3s |
| #70 | Claude Haiku 5.5 max | Anthropic | 1.0 | 0.8 | $0.509 | 3/3 | 55.9s |
| #72 | GPT-5 Mini medium | OpenAI | 1.0 | 0.8 | $0.315 | 3/3 | 27.6s |
| #73 | Muse Glimmer 30B xhigh | Meta | 1.0 | 0.8 | $0.585 | 3/3 | 105.9s |
| #76 | Muse Spark 1.1 high | Meta | 1.0 | 0.8 | $2.570 | 3/3 | 22.9s |