Échecs par catégorie AI BENCHY
Analyse et extraction des données : Mauvaise réponse
Analyse et extraction des données
Mauvaise réponse
Voyez quels modèles d'IA ont le plus de chances de rencontrer Mauvaise réponse sur Analyse et extraction des données, pour repérer plus vite les points faibles. Trier par: Nombre d'échecs ↑.
Raisons d'échec
| Rang | Modèle | Entreprise | Nombre de Mauvaise réponse | Score de catégorie | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|
| #10 | Claude Opus 4.8 medium | Anthropic | 1 | 7.1 | 1/2 | 12.3s |
| #43 | MiMo-V2.5-Pro medium | Xiaomi | 1 | 7.3 | 1/2 | 18.8s |
| #51 | Mimo V2 PRO medium | Xiaomi | 1 | 7.3 | 1/2 | 17.2s |
| #56 | MiMo-V2.5 medium | Xiaomi | 1 | 2.7 | 0/2 | 6.33s |
| #57 | Step 3.7 Flash low | Stepfun | 1 | 7.3 | 1/2 | 2.29s |
| #68 | Claude Opus 4.8 none | Anthropic | 1 | 7.3 | 1/2 | 1.77s |
| #75 | Ring-2.6-1T medium | Inclusionai | 1 | 6.5 | 1/2 | 37.4s |
| #81 | Mercury 2 medium | Inception | 1 | 7.3 | 1/2 | 1.11s |
| #96 | Ring-2.6-1T none | Inclusionai | 1 | 3.0 | 0/2 | 45.9s |
| #99 | gpt-oss-120b medium | OpenAI | 1 | 6.4 | 1/2 | 1.98s |
| #100 | Grok Build 0.1 none | X AI | 1 | 3.8 | 0/2 | 9.33s |
| #118 | Qwen3.6 27B none | Qwen | 1 | 7.3 | 1/2 | 2.06s |
| #119 | Cobuddy medium | Baidu | 1 | 6.3 | 1/2 | 17.4s |
| #122 | GLM 4.7 Flash none | Z.ai | 1 | 7.3 | 1/2 | 4.82s |
| #130 | MiniMax M2.7 medium | Minimax | 1 | 6.3 | 1/2 | 21.9s |