Combined Ranking
See which AI models perform best on Combined, which ones stay reliable, and where the biggest gaps appear. Sort by: Response Time (avg) ↑.
330/330
Filter models
No models match the current search and filters.
| Rank | Model | Company | Combined Score | Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #46 | Muse Spark 1.2 medium | Meta | 8.5 | 8.6 | $1.339 | 1/2 | 24.9s |
| #15 | GPT-5.6 Sol high | OpenAI | 10.0 | 9.4 | $0.446 | 2/2 | 25.0s |
| #193 | Seed-2.0-Lite none | Bytedance Seed | 3.0 | 6.2 | $0.066 | 0/2 | 25.6s |
| #67 | Muse Spark 1.3 low | Meta | 7.3 | 8.2 | $0.689 | 1/2 | 25.7s |
| #264 | Inkling none | Thinkingmachines | 2.9 | 5.2 | $0.147 | 0/2 | 25.7s |
| #219 | Mimo V2 Omni medium | Xiaomi | 5.0 | 5.9 | $0.683 | 1/1 | 25.9s |
| #32 | GPT-5.3-Codex medium | OpenAI | 10.0 | 8.9 | $0.988 | 2/2 | 26.0s |
| #128 | Claude Opus 4.8 none | Anthropic | 9.8 | 7.3 | $1.166 | 2/2 | 26.4s |
| #205 | Qwen3.6 Flash none | Qwen | 3.8 | 6.1 | $0.062 | 0/2 | 26.5s |
| #10 | Gemini 3 Flash Preview medium | 10.0 | 9.5 | $0.763 | 2/2 | 26.7s | |
| #48 | Claude Fable 5 medium | Anthropic | 6.5 | 8.6 | $3.004 | 1/2 | 27.5s |
| #53 | DeepSeek V4.1 Flash high | DeepSeek | 10.0 | 8.5 | $0.574 | 2/2 | 27.6s |
| #39 | Gemini 3.5 Flash Lite high | 9.9 | 8.8 | $0.540 | 2/2 | 27.9s | |
| #253 | MiMo-V2.5-Pro none | Xiaomi | 3.0 | 5.4 | $0.068 | 0/2 | 28.3s |
| #187 | LongCat 2.0 none | Meituan | 6.5 | 6.4 | $0.044 | 1/2 | 28.4s |