Classement des échecs pour N'a pas suivi les instructions

Voyez quels modèles d'IA rencontrent le plus souvent N'a pas suivi les instructions, pour repérer les risques de fiabilité avant de choisir. Trier par: Score ↓.

Modèles affichés

Échecs totaux

245

Modèle le plus touché

Gemini 3.5 Flash 1

Catégories

Dans la catégorie Résolution d'énigmes90 Dans la catégorie Intelligence générale78 Dans la catégorie Astuces anti-IA33 Dans la catégorie Suivi des instructions18 Dans la catégorie Programmation16 Dans la catégorie Appel d'outils8 Dans la catégorie Combiné1 Dans la catégorie Spécifique au domaine1

140/140

Rang	Modèle	Entreprise	Nombre de N'a pas suivi les instructions	Score	Coût total	Tests corrects	Temps de réponse (moy.)
#9	Gemini 3.5 Flash medium	Google	1	9.1	$0.642	19/22	8.20s
Tests totaux 22 Tests incorrects 3 Coût total $0.642 Temps de réponse (moy.) 8.20s
#12	Grok 4.5 high	X AI	1	8.9	$1.707	17/22	76.5s
Tests totaux 22 Tests incorrects 5 Coût total $1.707 Temps de réponse (moy.) 76.5s
#13	GPT-5.3-Codex medium	OpenAI	2	8.9	$0.920	16/22	17.0s
Tests totaux 22 Tests incorrects 6 Coût total $0.920 Temps de réponse (moy.) 17.0s
#16	Muse Spark 1.1 medium	Meta	2	8.6	$1.357	15/22	25.0s
Tests totaux 22 Tests incorrects 7 Coût total $1.357 Temps de réponse (moy.) 25.0s
#18	GPT-5.4 medium	OpenAI	2	8.5	$1.533	15/22	23.1s
Tests totaux 22 Tests incorrects 7 Coût total $1.533 Temps de réponse (moy.) 23.1s
#21	GPT-5.2 medium	OpenAI	3	8.4	$0.951	14/22	22.6s
Tests totaux 22 Tests incorrects 8 Coût total $0.951 Temps de réponse (moy.) 22.6s
#23	Claude Sonnet 5 medium	Anthropic	1	8.3	$0.922	16/22	12.5s
Tests totaux 22 Tests incorrects 6 Coût total $0.922 Temps de réponse (moy.) 12.5s
#24	Muse Spark 1.1 low	Meta	2	8.3	$0.647	13/22	11.5s
Tests totaux 22 Tests incorrects 9 Coût total $0.647 Temps de réponse (moy.) 11.5s
#25	Gemini 2.5 Flash medium	Google	1	8.2	$0.643	15/22	21.2s
Tests totaux 22 Tests incorrects 7 Coût total $0.643 Temps de réponse (moy.) 21.2s
#26	GPT-5 Mini medium	OpenAI	3	8.1	$0.237	12/22	27.6s
Tests totaux 22 Tests incorrects 10 Coût total $0.237 Temps de réponse (moy.) 27.6s
#27	Muse Spark 1.1 high	Meta	2	8.1	$1.694	12/22	31.5s
Tests totaux 22 Tests incorrects 10 Coût total $1.694 Temps de réponse (moy.) 31.5s
#28	Inkling high	Thinkingmachines	1	8.0	$1.006	15/22	64.2s
Tests totaux 22 Tests incorrects 7 Coût total $1.006 Temps de réponse (moy.) 64.2s
#29	Step 3.7 Flash medium	Stepfun	1	8.0	$0.515	14/22	26.4s
Tests totaux 22 Tests incorrects 8 Coût total $0.515 Temps de réponse (moy.) 26.4s
#30	GPT-5.2 Chat none	OpenAI	1	8.0	$0.604	14/22	7.65s
Tests totaux 22 Tests incorrects 8 Coût total $0.604 Temps de réponse (moy.) 7.65s
#31	GLM 5.2 high	Z.ai	1	8.0	$0.970	14/22	62.7s
Tests totaux 22 Tests incorrects 8 Coût total $0.970 Temps de réponse (moy.) 62.7s

Échecs N'a pas suivi les instructions

Filtrer les modèles

Meilleurs modèles par Nombre de N'a pas suivi les instructions

Nombre de N'a pas suivi les instructions vs Score

Meilleurs modèles par Temps de réponse (moy.)