General Intelligence Ranking
See which AI models perform best on General Intelligence, which ones stay reliable, and where the biggest gaps appear. Sort by: Response Time (avg) ↓.
319/319
Filter models
No models match the current search and filters.
| Rank | Model | Company | General Intelligence Score | Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #170 | Qwen3.6 35B A3B medium | Qwen | 4.4 | 6.6 | $0.672 | 0/1 | 8.66s |
| #52 | Muse Spark 1.2 low | Meta | 5.0 | 8.4 | $0.655 | 0/1 | 8.46s |
| #56 | Qwen3.8 27B high | Qwen | 5.0 | 8.4 | ~$0.287 | 0/1 | 8.45s |
| #4 | GPT-6 Astra high | OpenAI | 10.0 | 9.9 | $3.474 | 1/1 | 8.28s |
| #117 | GLM 5.3 high | Z.ai | 6.1 | 7.3 | $0.403 | 0/1 | 8.00s |
| #37 | Muse Spark 1.3 medium | Meta | 10.0 | 8.8 | $1.469 | 1/1 | 7.95s |
| #192 | gpt-oss-120b medium | OpenAI | 4.3 | 6.1 | $0.020 | 0/1 | 7.90s |
| #68 | Muse Spark 1.1 high | Meta | 10.0 | 8.0 | $2.253 | 1/1 | 7.73s |
| #5 | GPT-6 Astra xhigh | OpenAI | 10.0 | 9.9 | $5.156 | 1/1 | 7.68s |
| #69 | DeepSeek V4 Flash 0731 low | DeepSeek | 6.5 | 8.0 | $0.072 | 0/1 | 7.63s |
| #235 | Nemotron 3.5 Lightning high | NVIDIA | 3.7 | 5.6 | $0.134 | 0/1 | 7.58s |
| #36 | Qwen3.8 Max (0902) medium | Qwen | 10.0 | 8.8 | $0.677 | 1/1 | 7.56s |
| #47 | Claude Fable 5 medium | Anthropic | 10.0 | 8.6 | $3.004 | 1/1 | 7.42s |
| #66 | Muse Glimmer 30B xhigh | Meta | 5.5 | 8.1 | $0.471 | 0/1 | 7.41s |
| #228 | KAT-Coder-Air V2.5 high | Kwaipilot | 5.1 | 5.6 | $0.077 | 0/1 | 7.10s |