Coding Ranking
See which AI models perform best on Coding, which ones stay reliable, and where the biggest gaps appear. Sort by: Tests Correct ↓.
404/404
Filter models
No models match the current search and filters.
| Rank | Model | Company | Coding Score | Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #138 | Inkling Small high | Thinkingmachines | 1.0 | 0.7 | $0.398 | 3/3 | 93.2s |
| #151 | Qwen3.8 27B medium | Qwen | 1.0 | 0.7 | ~$0.073 | 3/3 | 40.5s |
| #155 | LongCat 2.0 medium | Meituan | 1.0 | 0.7 | $0.767 | 3/3 | 455.0s |
| #156 | GLM 5 medium | Z.ai | 1.0 | 0.7 | $0.479 | 3/3 | 74.3s |
| #168 | Ember-1 low | Fireworks | 1.0 | 0.7 | $1.488 | 3/3 | 37.9s |
| #289 | Claude Opus 4.7 none | Anthropic | 0.3 | 0.5 | $0.505 | 1/1 | 2.84s |
| #321 | Grok 4.20 Beta medium | X AI | 0.3 | 0.5 | $0.750 | 1/1 | 31.4s |
| #341 | Gemini 3.1 Flash Lite high | 0.3 | 0.5 | $2.044 | 1/1 | 137.6s | |
| #366 | Grok 4.20 Multi Agent Beta medium | X AI | 0.3 | 0.4 | $5.599 | 1/1 | 27.1s |
| #386 | Grok Build 0.1 none | X AI | 0.3 | 0.3 | $0.547 | 1/1 | 21.4s |
| #393 | Nemotron 3 Nano Omni 30b A3b Reasoning default | NVIDIA | 0.3 | 0.3 | $0.000 | 1/1 | 1.27s |
| #15 | Gemini 3 Flash Preview medium | 0.9 | 1.0 | $0.876 | 2/3 | 84.4s | |
| #17 | Gemini 3.7 Flash medium | 0.8 | 1.0 | $0.278 | 2/3 | 8.86s | |
| #18 | GPT-6 Sol medium | OpenAI | 0.8 | 0.9 | $0.703 | 2/3 | 11.8s |
| #25 | Gemini 3.7 Flash low | 0.8 | 0.9 | $0.183 | 2/3 | 6.20s |