Combined Ranking
See which AI models perform best on Combined, which ones stay reliable, and where the biggest gaps appear. Sort by: Response Time (avg) ↑.
330/330
Filter models
No models match the current search and filters.
| Rank | Model | Company | Combined Score | Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #12 | Gemini 3.7 Flash medium | 10.0 | 9.4 | $0.309 | 2/2 | 20.9s | |
| #211 | Grok 4.20 Beta medium | X AI | 5.0 | 6.0 | $0.750 | 1/1 | 20.9s |
| #41 | Claude Opus 5 low | Anthropic | 10.0 | 8.7 | $1.121 | 2/2 | 21.1s |
| #208 | Nemotron 3 Ultra none | NVIDIA | 3.0 | 6.1 | $0.093 | 0/2 | 21.1s |
| #302 | Laguna S 2.1 none | Poolside | 2.9 | 4.5 | $0.022 | 0/2 | 21.6s |
| #240 | Owl Alpha none | Openrouter | 1.5 | 5.6 | $0.000 | 0/1 | 21.7s |
| #54 | DeepSeek V4.1 Flash medium | DeepSeek | 10.0 | 8.5 | $0.544 | 2/2 | 22.2s |
| #203 | Inkling low | Thinkingmachines | 2.9 | 6.1 | $0.187 | 0/2 | 22.7s |
| #119 | Grok 4.6 low | X AI | 6.5 | 7.4 | $0.449 | 1/2 | 23.3s |
| #260 | Ling-2.6-1T none | Inclusionai | 6.5 | 5.3 | $0.016 | 1/2 | 23.8s |
| #21 | Claude Opus 5 medium | Anthropic | 10.0 | 9.2 | $1.586 | 2/2 | 23.9s |
| #199 | gpt-oss-120b medium | OpenAI | 6.5 | 6.1 | $0.070 | 1/2 | 24.0s |
| #246 | Qwen3.8 27B none | Qwen | 3.0 | 5.5 | ~$0.006 | 0/2 | 24.1s |
| #4 | GPT-6 Astra high | OpenAI | 10.0 | 9.9 | $3.474 | 2/2 | 24.4s |
| #52 | DeepSeek V4.1 Flash low | DeepSeek | 10.0 | 8.5 | $0.448 | 2/2 | 24.7s |