Classement des échecs pour N'a pas suivi les instructions

Voyez quels modèles d'IA rencontrent le plus souvent N'a pas suivi les instructions, pour repérer les risques de fiabilité avant de choisir. Trier par: Nombre d'échecs ↑.

Modèles affichés

Échecs totaux

245

Modèle le plus touché

Gemini 3.5 Flash 1

Catégories

Dans la catégorie Résolution d'énigmes90 Dans la catégorie Intelligence générale78 Dans la catégorie Astuces anti-IA33 Dans la catégorie Suivi des instructions18 Dans la catégorie Programmation16 Dans la catégorie Appel d'outils8 Dans la catégorie Combiné1 Dans la catégorie Spécifique au domaine1

140/140

Rang	Modèle	Entreprise	Nombre de N'a pas suivi les instructions	Score	Coût total	Tests corrects	Temps de réponse (moy.)
#9	Gemini 3.5 Flash medium	Google	1	9.1	$0.642	19/22	8.20s
Tests totaux 22 Tests incorrects 3 Coût total $0.642 Temps de réponse (moy.) 8.20s
#12	Grok 4.5 high	X AI	1	8.9	$1.707	17/22	76.5s
Tests totaux 22 Tests incorrects 5 Coût total $1.707 Temps de réponse (moy.) 76.5s
#23	Claude Sonnet 5 medium	Anthropic	1	8.3	$0.922	16/22	12.5s
Tests totaux 22 Tests incorrects 6 Coût total $0.922 Temps de réponse (moy.) 12.5s
#25	Gemini 2.5 Flash medium	Google	1	8.2	$0.643	15/22	21.2s
Tests totaux 22 Tests incorrects 7 Coût total $0.643 Temps de réponse (moy.) 21.2s
#28	Inkling high	Thinkingmachines	1	8.0	$1.006	15/22	64.2s
Tests totaux 22 Tests incorrects 7 Coût total $1.006 Temps de réponse (moy.) 64.2s
#29	Step 3.7 Flash medium	Stepfun	1	8.0	$0.515	14/22	26.4s
Tests totaux 22 Tests incorrects 8 Coût total $0.515 Temps de réponse (moy.) 26.4s
#30	GPT-5.2 Chat none	OpenAI	1	8.0	$0.604	14/22	7.65s
Tests totaux 22 Tests incorrects 8 Coût total $0.604 Temps de réponse (moy.) 7.65s
#31	GLM 5.2 high	Z.ai	1	8.0	$0.970	14/22	62.7s
Tests totaux 22 Tests incorrects 8 Coût total $0.970 Temps de réponse (moy.) 62.7s
#37	Qwen3.6 Plus medium	Qwen	1	7.8	$0.405	15/22	43.1s
Tests totaux 22 Tests incorrects 7 Coût total $0.405 Temps de réponse (moy.) 43.1s
#42	GLM 5 medium	Z.ai	1	7.7	$0.307	15/21	33.5s
Tests totaux 21 Tests incorrects 6 Coût total $0.307 Temps de réponse (moy.) 33.5s
#43	Claude Opus 4.6 medium	Anthropic	1	7.7	$3.059	13/22	34.3s
Tests totaux 22 Tests incorrects 9 Coût total $3.059 Temps de réponse (moy.) 34.3s
#49	GLM 5 Turbo medium	Z.ai	1	7.6	$0.323	14/21	23.0s
Tests totaux 21 Tests incorrects 7 Coût total $0.323 Temps de réponse (moy.) 23.0s
#52	Kimi K2.7 Code medium	Moonshot AI	1	7.5	$0.751	12/22	84.2s
Tests totaux 22 Tests incorrects 10 Coût total $0.751 Temps de réponse (moy.) 84.2s
#63	Claude Sonnet 4.6 none	Anthropic	1	7.3	$0.661	12/22	8.12s
Tests totaux 22 Tests incorrects 10 Coût total $0.661 Temps de réponse (moy.) 8.12s
#64	Gemini 3.1 Flash Lite Preview medium	Google	1	7.3	$0.115	13/22	4.61s
Tests totaux 22 Tests incorrects 9 Coût total $0.115 Temps de réponse (moy.) 4.61s

Échecs N'a pas suivi les instructions

Filtrer les modèles

Meilleurs modèles par Nombre de N'a pas suivi les instructions

Nombre de N'a pas suivi les instructions vs Score

Meilleurs modèles par Temps de réponse (moy.)