Coding Ranking
See which AI models perform best on Coding, which ones stay reliable, and where the biggest gaps appear. Sort by: Response Time (avg) ↑.
408/408
Filter models
No models match the current search and filters.
| Rank | Model | Company | Coding Score | Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #81 | Gemini 3.5 Flash high | 1.0 | 0.8 | $2.737 | 3/3 | 23.0s | |
| #315 | KAT Coder AIR V2.5 medium | Kwaipilot | 0.4 | 0.5 | $0.048 | 0/3 | 23.4s |
| #371 | Grok 4.1 Fast medium | X AI | 0.8 | 0.4 | $0.069 | 0/1 | 23.6s |
| #83 | GPT-6 Luna medium | OpenAI | 0.7 | 0.8 | $0.047 | 1/3 | 23.6s |
| #302 | Kimi K2.5 none | Moonshot AI | 0.5 | 0.5 | $0.262 | 1/3 | 24.6s |
| #103 | GLM 5.3 FlashX max | Z.ai | 0.8 | 0.8 | $0.623 | 2/3 | 24.6s |
| #118 | GPT-6 Luna high | OpenAI | 0.8 | 0.8 | $0.074 | 2/3 | 24.7s |
| #204 | KAT-Coder-Pro V2.5 low | Kwaipilot | 0.8 | 0.7 | $0.568 | 2/3 | 24.9s |
| #140 | Inkling medium | Thinkingmachines | 0.8 | 0.7 | $0.527 | 2/3 | 25.2s |
| #1 | Gemini 3.6 Flash high | 1.0 | 1.0 | $0.900 | 3/3 | 26.3s | |
| #97 | Nemotron 3 Ultra medium | NVIDIA | 0.8 | 0.8 | $0.674 | 2/3 | 26.5s |
| #369 | Grok 4.20 Multi Agent Beta medium | X AI | 0.3 | 0.4 | $5.599 | 1/1 | 27.1s |
| #113 | Step 3.7 Flash medium | Stepfun | 0.9 | 0.8 | $0.571 | 2/3 | 27.4s |
| #72 | GPT-5 Mini medium | OpenAI | 1.0 | 0.8 | $0.315 | 3/3 | 27.6s |
| #352 | Hy3 preview low | Tencent | 0.5 | 0.5 | $0.042 | 1/3 | 27.9s |