Classement Culture générale
Voyez quels modèles d'IA réussissent le mieux sur Culture générale, lesquels restent fiables et où les écarts sont les plus marqués. Trier par: Coût total ↑.
250/250
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Score Culture générale | Score | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #97 | Kimi K2.5 medium | Moonshot AI | 3.0 | 7.0 | $0.600 | 0/1 | 83.9s |
| #44 | GPT-5.2 Chat none | OpenAI | 3.0 | 8.0 | $0.604 | 0/1 | 6.89s |
| #128 | Gemini 3.1 Flash Lite low | 3.0 | 6.5 | $0.621 | 0/1 | 1.46s | |
| #215 | Trinity Large Thinking high | Arcee AI | 3.0 | 4.8 | $0.632 | 0/1 | 125.1s |
| #13 | Gemini 3.5 Flash medium | 10.0 | 9.1 | $0.642 | 1/1 | 2.75s | |
| #38 | Gemini 2.5 Flash medium | 3.0 | 8.2 | $0.643 | 0/1 | 2.76s | |
| #127 | Gemini 3.1 Flash Lite Preview low | 3.0 | 6.5 | $0.646 | 0/1 | 1.35s | |
| #37 | Muse Spark 1.1 low | Meta | 3.0 | 8.3 | $0.647 | 0/1 | 8.17s |
| #30 | Muse Spark 1.2 low | Meta | 3.0 | 8.4 | $0.650 | 0/1 | 10.00s |
| #155 | Trinity Large Thinking low | Arcee AI | 3.0 | 6.0 | $0.656 | 0/1 | 2.10s |
| #81 | Claude Sonnet 4.6 none | Anthropic | 3.0 | 7.3 | $0.661 | 0/1 | 4.67s |
| #161 | Mimo V2 Omni medium | Xiaomi | 3.0 | 5.9 | $0.683 | 0/1 | 234.2s |
| #70 | Kimi K2.7 Code medium | Moonshot AI | 3.0 | 7.5 | $0.686 | 0/1 | 341.8s |
| #24 | Qwen3.8 Max low | Qwen | 3.0 | 8.7 | $0.687 | 0/1 | 12.4s |
| #14 | Qwen3.8 Max medium | Qwen | 3.0 | 9.1 | $0.728 | 0/1 | 11.5s |