AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Échecs par catégorie AI BENCHY

Spécifique au domaine : Mauvaise réponse

Spécifique au domaine
Mauvaise réponse

Voyez quels modèles d'IA ont le plus de chances de rencontrer Mauvaise réponse sur Spécifique au domaine, pour repérer plus vite les points faibles.

Modèles affichés

15

Échecs totaux

182

Modèle le plus touché

Qwen3.6 Plus Preview 3
Rang Modèle Entreprise Nombre de Mauvaise réponse Score de catégorie Tests corrects Temps de réponse (moy.)
#32 Qwen3.5-Flash medium Qwen 1 5.3 1/3 146.5s
#33 GLM 5.1 medium Z.ai 1 5.3 1/3 29.8s
#35 MiMo-V2-Omni medium Xiaomi 1 3.0 0/3 55.1s
#37 Claude Opus 4.6 medium Anthropic 1 3.0 0/3 83.4s
#40 GPT-5.2 medium OpenAI 1 5.9 1/3 77.8s
#42 Claude Sonnet 4.6 none Anthropic 1 7.7 2/3 3.54s
#43 Qwen3.5-35B-A3B medium Qwen 1 4.1 0/3 88.3s
#47 Grok 4.20 medium X AI 1 5.3 1/3 27.0s
#48 Gemma 4 31B none Google 1 7.7 2/3 3.22s
#50 Hunter Alpha medium OpenRouter 1 3.0 0/3 10.5s
#52 Grok 4.1 Fast medium X AI 1 5.8 1/3 121.8s
#57 GPT-5 Nano medium OpenAI 1 5.2 1/3 204.0s
#59 Qwen3.5-Flash none Qwen 1 7.7 2/3 905ms
#63 Qwen3.5-35B-A3B none Qwen 1 7.7 2/3 485ms
#73 Mistral Small 4 medium Mistral 1 5.3 1/3 6.11s

Meilleurs modèles par Nombre de Mauvaise réponse

Nombre de Mauvaise réponse vs Score

Meilleurs modèles par Temps de réponse (moy.)

Meilleurs modèles par Coût gaspillé estimé