Combined Ranking
See which AI models perform best on Combined, which ones stay reliable, and where the biggest gaps appear. Sort by: Response Time (avg) ↓.
330/330
Filter models
No models match the current search and filters.
| Rank | Model | Company | Combined Score | Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #103 | GPT-5.4 Nano medium | OpenAI | 9.9 | 7.5 | $0.142 | 2/2 | 32.2s |
| #196 | Claude Sonnet 5 none | Anthropic | 6.5 | 6.1 | $0.548 | 1/2 | 31.4s |
| #282 | Mercury 2.5 Preview none | Inception | 3.0 | 4.9 | $0.018 | 0/2 | 31.3s |
| #20 | Claude Opus 5 high | Anthropic | 10.0 | 9.2 | $3.070 | 2/2 | 31.1s |
| #270 | Qwen3 Coder Next none | Qwen | 3.0 | 5.1 | $0.026 | 0/2 | 30.9s |
| #102 | Claude Opus 5 none | Anthropic | 8.3 | 7.5 | $1.550 | 1/2 | 30.5s |
| #294 | Hunter Alpha medium | OpenRouter | 2.3 | 4.7 | $0.000 | 0/1 | 30.5s |
| #36 | Gemini 3.5 Flash low | 8.2 | 8.8 | $0.449 | 1/2 | 30.0s | |
| #206 | Gemma 4 31B none | 3.8 | 6.1 | $0.016 | 0/2 | 30.0s | |
| #51 | GPT-5.4 medium | OpenAI | 10.0 | 8.5 | $1.560 | 2/2 | 29.8s |
| #64 | Muse Spark 1.1 low | Meta | 6.6 | 8.3 | $0.673 | 1/2 | 29.4s |
| #150 | Claude Fable 5.1 low | Anthropic | 10.0 | 6.9 | $2.565 | 2/2 | 29.4s |
| #55 | Grok 4.5 medium | X AI | 10.0 | 8.5 | $2.042 | 2/2 | 29.0s |
| #93 | GLM 5 medium | Z.ai | 5.0 | 7.7 | $0.228 | 1/1 | 29.0s |
| #272 | MiMo-V2.5 none | Xiaomi | 3.0 | 5.1 | $0.025 | 0/2 | 28.9s |