AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Échecs par catégorie AI BENCHY

Suivi des instructions : Mauvaise réponse

Suivi des instructions
Mauvaise réponse

Voyez quels modèles d'IA ont le plus de chances de rencontrer Mauvaise réponse sur Suivi des instructions, pour repérer plus vite les points faibles. Trier par: Temps de réponse (moy.) ↓.

Modèles affichés

15

Échecs totaux

53

Modèle le plus touché

MiniMax M2.7 1
Rang Modèle Entreprise Nombre de Mauvaise réponse Score de catégorie Tests corrects Temps de réponse (moy.)
#130 MiniMax M2.7 medium Minimax 1 3.8 0/2 12.8s
#111 Owl Alpha medium Openrouter 1 6.5 1/2 10.2s
#108 Qwen3.5-Flash none Qwen 1 6.3 1/2 8.81s
#113 DeepSeek V4 Pro none DeepSeek 1 6.3 1/2 8.23s
#140 Qwen3 Coder Next none Qwen 1 6.3 1/2 7.78s
#150 Qwen3 Coder Next medium Qwen 1 6.3 1/2 7.49s
#55 GLM 5.1 medium Z.ai 1 6.4 1/2 7.47s
#159 Ling-2.6-1T none Inclusionai 1 6.4 1/2 5.36s
#101 Mimo V2 Omni none Xiaomi 1 6.5 1/2 4.26s
#158 GLM 4.7 Flash medium Z.ai 1 6.2 1/2 2.97s
#85 Gemma 4 31B none Google 1 6.5 1/2 2.84s
#116 Hunter Alpha none OpenRouter 1 6.4 1/2 2.82s
#135 Kimi K2.5 none Moonshot AI 1 6.5 1/2 2.67s
#121 Owl Alpha none Openrouter 1 6.4 1/2 2.63s
#120 Mimo V2 PRO none Xiaomi 1 6.5 1/2 2.51s

Meilleurs modèles par Nombre de Mauvaise réponse

Nombre de Mauvaise réponse vs Score

Meilleurs modèles par Temps de réponse (moy.)

Meilleurs modèles par Coût gaspillé estimé