AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Échecs par catégorie AI BENCHY

Spécifique au domaine : Mauvaise réponse

Spécifique au domaine
Mauvaise réponse

Voyez quels modèles d'IA ont le plus de chances de rencontrer Mauvaise réponse sur Spécifique au domaine, pour repérer plus vite les points faibles. Trier par: Temps de réponse (moy.) ↑.

Modèles affichés

15

Échecs totaux

314

Modèle le plus touché

GLM 5 2
Rang Modèle Entreprise Nombre de Mauvaise réponse Score de catégorie Tests corrects Temps de réponse (moy.)
#17 GLM 5 medium Z.ai 2 3.5 0/3 0ms
#52 Claude Sonnet 4.6 medium Anthropic 1 2.9 0/3 0ms
#160 LFM2-24B-A2B none Liquid 1 5.9 1/3 287ms
#163 Granite 4.1 8B none IBM Granite 3 3.0 0/3 357ms
#142 Mistral Small 4 none Mistral 2 5.3 1/3 367ms
#146 Laguna Xs.2 none Poolside 2 5.3 1/3 371ms
#154 Qwen3.5-9B none Qwen 3 3.0 0/3 464ms
#131 Qwen3.5-122B-A10B none Qwen 2 5.3 1/3 465ms
#117 Qwen3.5-35B-A3B none Qwen 1 7.7 2/3 485ms
#162 Nemotron 3 Nano Omni 30b A3b Reasoning none NVIDIA 3 3.6 0/3 489ms
#97 Gemini 2.5 Flash none Google 2 5.9 1/3 495ms
#155 Mercury 2 none Inception 2 5.3 1/3 534ms
#115 Qwen3.5-27B none Qwen 3 3.0 0/3 540ms
#152 MiMo-V2-Flash none Xiaomi 2 5.3 1/3 564ms
#106 Grok 4.20 Beta none X AI 3 3.0 0/3 611ms

Meilleurs modèles par Nombre de Mauvaise réponse

Nombre de Mauvaise réponse vs Score

Meilleurs modèles par Temps de réponse (moy.)

Meilleurs modèles par Coût gaspillé estimé