Catégorie AI BENCHY
Classement Culture générale
Voyez quels modèles d'IA réussissent le mieux sur Culture générale, lesquels restent fiables et où les écarts sont les plus marqués. Trier par: Tests corrects ↓.
Modèles affichés
15
Moyenne de Score Culture générale
2.9
Meilleur modèle
Gemini 3 Flash Preview 10.0Raisons d'échec
| Rang | Modèle | Entreprise | Score Culture générale | Score | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|
| #116 | Elephant Alpha none | Openrouter | 0.0 | 5.3 | 0/0 | 0ms |
| #117 | Laguna Xs.2 none | Poolside | 0.0 | 5.3 | 0/0 | 0ms |
| #118 | Ling-2.6-flash none | Inclusionai | 3.0 | 5.3 | 0/1 | 1.06s |
| #119 | gpt-oss-120b none | OpenAI | 3.0 | 5.2 | 0/1 | 47.3s |
| #120 | DeepSeek V4 Flash none | DeepSeek | 3.0 | 5.2 | 0/1 | 3.07s |
| #121 | Qwen3 Coder Next none | Qwen | 3.0 | 5.2 | 0/1 | 601ms |
| #122 | Nemotron 3 Super none | NVIDIA | 3.0 | 5.2 | 0/1 | 8.94s |
| #123 | MiniMax M2.7 medium | Minimax | 3.0 | 5.1 | 0/1 | 22.8s |
| #124 | Mistral Small 4 none | Mistral | 3.0 | 5.1 | 0/1 | 397ms |
| #125 | GPT-5.4 Mini none | OpenAI | 3.0 | 5.0 | 0/1 | 1.33s |
| #126 | Qwen3.6 35B A3B none | Qwen | 3.0 | 5.0 | 0/1 | 414ms |
| #127 | GPT-4o-mini none | OpenAI | 3.0 | 4.9 | 0/1 | 794ms |
| #128 | MiMo-V2.5 none | Xiaomi | 3.0 | 4.9 | 0/1 | 3.89s |
| #129 | Qwen3 Coder Next medium | Qwen | 3.0 | 4.8 | 0/1 | 399ms |
| #130 | Trinity Large Preview none | Arcee AI | 3.0 | 4.8 | 0/1 | 777ms |