Coding Ranking
See which AI models perform best on Coding, which ones stay reliable, and where the biggest gaps appear.
289/289
Filter models
No models match the current search and filters.
| Rank | Model | Company | Coding Score | Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #91 | Qwen3.7 Max none | Qwen | 5.5 | 7.4 | $0.197 | 1/3 | 1.35s |
| #98 | Claude Sonnet 4.6 none | Anthropic | 5.5 | 7.3 | $0.661 | 1/3 | 5.19s |
| #101 | Gemini 3.1 Flash Lite medium | 5.5 | 7.3 | $0.120 | 1/3 | 3.81s | |
| #102 | Qwen3.7 Plus none | Qwen | 5.5 | 7.3 | $0.106 | 1/3 | 2.15s |
| #104 | Claude Opus 4.8 none | Anthropic | 5.5 | 7.3 | $1.166 | 1/3 | 3.29s |
| #116 | GPT-5.6 Sol none | OpenAI | 5.5 | 7.0 | $0.262 | 1/3 | 1.39s |
| #119 | GPT-5.5 none | OpenAI | 5.5 | 7.0 | $0.544 | 1/3 | 1.35s |
| #136 | Gemini 3 Flash Preview none | 5.5 | 6.8 | $0.085 | 1/3 | 1.80s | |
| #147 | Gemini 3.1 Flash Lite Preview low | 5.5 | 6.6 | $0.646 | 1/3 | 1.39s | |
| #149 | Gemini 3.1 Flash Lite low | 5.5 | 6.6 | $0.621 | 1/3 | 1.53s | |
| #153 | Laguna XS 2.1 medium | Poolside | 5.5 | 6.5 | $0.068 | 1/3 | 70.3s |
| #155 | Gemini 3.1 Flash Lite Preview none | 5.5 | 6.4 | $0.052 | 1/3 | 967ms | |
| #159 | LongCat 2.0 none | Meituan | 5.5 | 6.4 | $0.044 | 1/3 | 2.85s |
| #167 | GPT-5.6 Luna low | OpenAI | 5.5 | 6.2 | $0.051 | 1/3 | 4.61s |
| #169 | Gemini 3.1 Flash Lite minimal | 5.5 | 6.1 | $0.047 | 1/3 | 831ms |