Combined Ranking
See which AI models perform best on Combined, which ones stay reliable, and where the biggest gaps appear. Sort by: Response Time (avg) ↑.
311/311
Filter models
No models match the current search and filters.
| Rank | Model | Company | Combined Score | Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #66 | Kimi K3 max | Moonshot AI | 6.5 | 7.9 | $3.467 | 1/2 | 223.0s |
| #56 | Qwen3.8 2.4T A95B low | Qwen | 8.2 | 8.1 | $2.672 | 1/2 | 231.8s |
| #79 | Qwen3.7 Flash high | Qwen | 6.9 | 7.8 | $0.052 | 1/2 | 232.0s |
| #200 | Qwen3.5-Flash none | Qwen | 2.9 | 6.0 | $0.073 | 0/2 | 243.6s |
| #175 | Ring-2.6-1T medium | Inclusionai | 7.3 | 6.4 | $0.102 | 1/2 | 257.3s |
| #212 | Nemotron 3 Super medium | NVIDIA | 6.4 | 5.7 | $0.050 | 1/2 | 259.9s |
| #272 | Trinity Large Thinking high | Arcee AI | 3.0 | 4.8 | $0.592 | 0/2 | 262.4s |
| #105 | Qwen3.8 2.4T A95B high | Qwen | 6.9 | 7.4 | $2.357 | 1/2 | 266.1s |
| #187 | Qwen3.5-Flash medium | Qwen | 6.4 | 6.1 | $0.142 | 1/2 | 266.6s |
| #58 | Muse Glimmer 30B xhigh | Meta | 6.0 | 8.1 | $0.510 | 0/2 | 272.7s |
| #245 | Gemini 3.1 Flash Lite Preview high | 5.0 | 5.3 | $2.310 | 1/1 | 280.5s | |
| #133 | Seed-2.0-Mini medium | Bytedance Seed | 7.3 | 7.0 | $0.116 | 1/2 | 282.3s |
| #234 | Laguna S 2.1 medium | Poolside | 3.2 | 5.4 | $0.053 | 0/2 | 284.7s |
| #19 | Qwen3.7 Max medium | Qwen | 8.7 | 9.1 | $1.157 | 1/2 | 287.8s |
| #194 | Trinity Large Thinking low | Arcee AI | 5.2 | 6.0 | $0.625 | 0/2 | 291.0s |