Classement des échecs pour N'a pas suivi les instructions

Voyez quels modèles d'IA rencontrent le plus souvent N'a pas suivi les instructions, pour repérer les risques de fiabilité avant de choisir. Trier par: Tests corrects ↓.

Modèles affichés

Échecs totaux

250

Modèle le plus touché

Gemini 3.5 Flash 1

Catégories

Dans la catégorie Résolution d'énigmes90 Dans la catégorie Intelligence générale78 Dans la catégorie Astuces anti-IA33 Dans la catégorie Suivi des instructions23 Dans la catégorie Programmation16 Dans la catégorie Appel d'outils8 Dans la catégorie Combiné1 Dans la catégorie Spécifique au domaine1

145/145

Rang	Modèle	Entreprise	Nombre de N'a pas suivi les instructions	Score	Coût total	Tests corrects	Temps de réponse (moy.)
#89	Qwen3.6 Flash medium	Qwen	1	6.9	$0.738	12/22	44.7s
Tests totaux 22 Tests incorrects 10 Coût total $0.738 Temps de réponse (moy.) 44.7s
#101	GLM 5.2 none	Z.ai	1	6.6	$0.124	12/22	9.34s
Tests totaux 22 Tests incorrects 10 Coût total $0.124 Temps de réponse (moy.) 9.34s
#107	MiMo-V2.5 medium	Xiaomi	1	6.5	$0.082	12/22	32.2s
Tests totaux 22 Tests incorrects 10 Coût total $0.082 Temps de réponse (moy.) 32.2s
#112	Gemini 3.1 Flash Lite Preview none	Google	2	6.4	$0.052	12/22	1.58s
Tests totaux 22 Tests incorrects 10 Coût total $0.052 Temps de réponse (moy.) 1.58s
#120	Qwen3.5-Flash medium	Qwen	1	6.2	$0.139	12/22	84.8s
Tests totaux 22 Tests incorrects 10 Coût total $0.139 Temps de réponse (moy.) 84.8s
#98	GLM 5V Turbo medium	Z.ai	1	6.7	$0.457	11/21	23.1s
Tests totaux 21 Tests incorrects 10 Coût total $0.457 Temps de réponse (moy.) 23.1s
#136	Step 3.5 Flash medium	Stepfun	3	6.0	$0.108	11/21	174.2s
Tests totaux 21 Tests incorrects 10 Coût total $0.108 Temps de réponse (moy.) 174.2s
#75	Qwen3.7 Plus none	Qwen	1	7.2	$0.106	11/22	12.1s
Tests totaux 22 Tests incorrects 11 Coût total $0.106 Temps de réponse (moy.) 12.1s
#80	DeepSeek V3.2 medium	DeepSeek	1	7.0	$0.078	11/22	68.6s
Tests totaux 22 Tests incorrects 11 Coût total $0.078 Temps de réponse (moy.) 68.6s
#84	Seed-2.0-Mini medium	Bytedance Seed	1	7.0	$0.101	11/22	92.5s
Tests totaux 22 Tests incorrects 11 Coût total $0.101 Temps de réponse (moy.) 92.5s
#85	KAT-Coder-Pro V2.5 medium	Kwaipilot	1	6.9	$0.467	11/22	24.0s
Tests totaux 22 Tests incorrects 11 Coût total $0.467 Temps de réponse (moy.) 24.0s
#87	GPT-5.6 Sol none	OpenAI	1	6.9	$0.524	11/22	2.16s
Tests totaux 22 Tests incorrects 11 Coût total $0.524 Temps de réponse (moy.) 2.16s
#114	Ring-2.6-1T medium	Inclusionai	2	6.3	$0.103	11/22	68.7s
Tests totaux 22 Tests incorrects 11 Coût total $0.103 Temps de réponse (moy.) 68.7s
#219	Step 3.5 Flash none	Stepfun	1	2.3	$0.020	6/12	39.0s
Tests totaux 12 Tests incorrects 6 Coût total $0.020 Temps de réponse (moy.) 39.0s
#140	Mimo V2 Omni medium	Xiaomi	2	5.9	$0.683	10/21	41.2s
Tests totaux 21 Tests incorrects 11 Coût total $0.683 Temps de réponse (moy.) 41.2s

Échecs N'a pas suivi les instructions

Filtrer les modèles

Meilleurs modèles par Nombre de N'a pas suivi les instructions

Nombre de N'a pas suivi les instructions vs Score

Meilleurs modèles par Temps de réponse (moy.)