AI BENCHY
Advertise here

Échecs par catégorie AI BENCHY

Analyse et extraction des données : Mauvaise réponse

Analyse et extraction des données
Mauvaise réponse

Voyez quels modèles d'IA ont le plus de chances de rencontrer Mauvaise réponse sur Analyse et extraction des données, pour repérer plus vite les points faibles. Trier par: Nombre d'échecs ↑.

Modèles affichés

15

Échecs totaux

35

Modèle le plus touché

Claude Opus 4.8 1
Rang Modèle Entreprise Nombre de Mauvaise réponse Score de catégorie Tests corrects Temps de réponse (moy.)
#10 Claude Opus 4.8 medium Anthropic 1 7.1 1/2 12.3s
#43 MiMo-V2.5-Pro medium Xiaomi 1 7.3 1/2 18.8s
#51 Mimo V2 PRO medium Xiaomi 1 7.3 1/2 17.2s
#56 MiMo-V2.5 medium Xiaomi 1 2.7 0/2 6.33s
#57 Step 3.7 Flash low Stepfun 1 7.3 1/2 2.29s
#68 Claude Opus 4.8 none Anthropic 1 7.3 1/2 1.77s
#75 Ring-2.6-1T medium Inclusionai 1 6.5 1/2 37.4s
#81 Mercury 2 medium Inception 1 7.3 1/2 1.11s
#96 Ring-2.6-1T none Inclusionai 1 3.0 0/2 45.9s
#99 gpt-oss-120b medium OpenAI 1 6.4 1/2 1.98s
#100 Grok Build 0.1 none X AI 1 3.8 0/2 9.33s
#118 Qwen3.6 27B none Qwen 1 7.3 1/2 2.06s
#119 Cobuddy medium Baidu 1 6.3 1/2 17.4s
#122 GLM 4.7 Flash none Z.ai 1 7.3 1/2 4.82s
#130 MiniMax M2.7 medium Minimax 1 6.3 1/2 21.9s

Meilleurs modèles par Nombre de Mauvaise réponse

Nombre de Mauvaise réponse vs Score

Meilleurs modèles par Temps de réponse (moy.)

Meilleurs modèles par Coût gaspillé estimé