AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Échecs par catégorie AI BENCHY

Suivi des instructions : Mauvaise réponse

Suivi des instructions
Mauvaise réponse

Voyez quels modèles d'IA ont le plus de chances de rencontrer Mauvaise réponse sur Suivi des instructions, pour repérer plus vite les points faibles.

Modèles affichés

15

Échecs totaux

53

Modèle le plus touché

Gemini 3.5 Flash 1
Rang Modèle Entreprise Nombre de Mauvaise réponse Score de catégorie Tests corrects Temps de réponse (moy.)
#115 Qwen3.5-27B none Qwen 1 6.3 1/2 1.03s
#116 Hunter Alpha none OpenRouter 1 6.4 1/2 2.82s
#117 Qwen3.5-35B-A3B none Qwen 1 6.3 1/2 809ms
#118 Qwen3.6 27B none Qwen 1 6.2 1/2 1.92s
#120 Mimo V2 PRO none Xiaomi 1 6.5 1/2 2.51s
#121 Owl Alpha none Openrouter 1 6.4 1/2 2.63s
#122 GLM 4.7 Flash none Z.ai 1 6.5 1/2 888ms
#123 MiMo-V2.5-Pro none Xiaomi 1 6.4 1/2 1.03s
#124 Kimi K2.6 none Moonshot AI 1 6.5 1/2 1.64s
#125 GPT-5.4 none OpenAI 1 6.5 1/2 1.07s
#127 Grok 4.20 none X AI 1 6.3 1/2 445ms
#128 Qwen3.6 Flash none Qwen 1 6.3 1/2 1.10s
#130 MiniMax M2.7 medium Minimax 1 3.8 0/2 12.8s
#131 Qwen3.5-122B-A10B none Qwen 1 6.3 1/2 513ms
#132 Mistral Small 4 medium Mistral 1 7.3 1/2 1.38s

Meilleurs modèles par Nombre de Mauvaise réponse

Nombre de Mauvaise réponse vs Score

Meilleurs modèles par Temps de réponse (moy.)

Meilleurs modèles par Coût gaspillé estimé