Échecs AI BENCHY
Échecs Mauvaise réponse
Voyez quels modèles d'IA rencontrent le plus souvent Mauvaise réponse, pour repérer les risques de fiabilité avant de choisir. Trier par: Temps de réponse (moy.) ↓.
Catégories
Dans la catégorie Spécifique au domaine314 Dans la catégorie Astuces anti-IA245 Dans la catégorie Programmation194 Dans la catégorie Résolution d'énigmes147 Dans la catégorie Culture générale130 Dans la catégorie Suivi des instructions53 Dans la catégorie Combiné52 Dans la catégorie Analyse et extraction des données35 Dans la catégorie Intelligence générale32 Dans la catégorie Appel d'outils2
| Rang | Modèle | Entreprise | Nombre de Mauvaise réponse | Score | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|
| #76 | Kimi K2.5 medium | Moonshot AI | 5 | 6.8 | 10/21 | 98.4s |
| #161 | Qwen3.5-9B medium | Qwen | 2 | 4.2 | 3/21 | 82.2s |
| #73 | Seed-2.0-Mini medium | Bytedance Seed | 4 | 6.9 | 11/21 | 80.2s |
| #25 | Qwen3.5 Plus 2026-02-15 medium | Qwen | 4 | 7.9 | 14/21 | 73.8s |
| #66 | Qwen3.5-35B-A3B medium | Qwen | 2 | 7.1 | 11/21 | 72.6s |
| #62 | Step 3.5 Flash medium | Stepfun | 4 | 7.2 | 11/20 | 72.5s |
| #60 | Kimi K2.6 medium | Moonshot AI | 3 | 7.2 | 12/21 | 71.7s |
| #72 | DeepSeek V3.2 medium | DeepSeek | 5 | 7.0 | 11/21 | 68.7s |
| #30 | Qwen3.5-27B medium | Qwen | 4 | 7.8 | 13/21 | 68.4s |
| #67 | MiniMax M3 medium | Minimax | 3 | 7.1 | 11/21 | 68.2s |
| #12 | Gemini 3.1 Flash Lite Preview high | 2 | 8.6 | 13/16 | 68.1s | |
| #129 | MiniMax M2.5 medium | Minimax | 7 | 5.3 | 5/21 | 65.4s |
| #103 | DeepSeek V4 Pro high | DeepSeek | 4 | 6.0 | 8/21 | 65.2s |
| #71 | Step 3.7 Flash high | Stepfun | 6 | 7.0 | 11/21 | 64.5s |
| #37 | Gemma 4 26B A4B medium | 3 | 7.6 | 14/21 | 63.4s |