Classement des échecs pour N'a pas suivi les instructions

Voyez quels modèles d'IA rencontrent le plus souvent N'a pas suivi les instructions, pour repérer les risques de fiabilité avant de choisir. Trier par: Temps de réponse (moy.) ↑.

Modèles affichés

Échecs totaux

250

Modèle le plus touché

Nemotron 3 Nano Omni 30b A3b Reasoning 2

Catégories

Dans la catégorie Résolution d'énigmes90 Dans la catégorie Intelligence générale78 Dans la catégorie Astuces anti-IA33 Dans la catégorie Suivi des instructions23 Dans la catégorie Programmation16 Dans la catégorie Appel d'outils8 Dans la catégorie Combiné1 Dans la catégorie Spécifique au domaine1

145/145

Rang	Modèle	Entreprise	Nombre de N'a pas suivi les instructions	Score	Coût total	Tests corrects	Temps de réponse (moy.)
#162	Gemma 4 26B A4B none	Google	2	5.5	$0.015	8/22	7.64s
Tests totaux 22 Tests incorrects 14 Coût total $0.015 Temps de réponse (moy.) 7.64s
#34	GPT-5.2 Chat none	OpenAI	1	8.0	$0.604	14/22	7.65s
Tests totaux 22 Tests incorrects 8 Coût total $0.604 Temps de réponse (moy.) 7.65s
#67	Claude Sonnet 4.6 none	Anthropic	1	7.3	$0.661	12/22	8.12s
Tests totaux 22 Tests incorrects 10 Coût total $0.661 Temps de réponse (moy.) 8.12s
#12	Gemini 3.5 Flash medium	Google	1	9.1	$0.642	19/22	8.20s
Tests totaux 22 Tests incorrects 3 Coût total $0.642 Temps de réponse (moy.) 8.20s
#155	KAT-Coder-Air V2.5 medium	Kwaipilot	1	5.6	$0.048	8/22	8.42s
Tests totaux 22 Tests incorrects 14 Coût total $0.048 Temps de réponse (moy.) 8.42s
#170	Ling-2.6-1T none	Inclusionai	2	5.3	$0.016	4/22	8.58s
Tests totaux 22 Tests incorrects 18 Coût total $0.016 Temps de réponse (moy.) 8.58s
#174	Qwen3 Coder Next none	Qwen	1	5.1	$0.025	5/22	9.12s
Tests totaux 22 Tests incorrects 17 Coût total $0.025 Temps de réponse (moy.) 9.12s
#185	GLM 4.7 Flash none	Z.ai	1	4.9	$0.016	6/22	9.15s
Tests totaux 22 Tests incorrects 16 Coût total $0.016 Temps de réponse (moy.) 9.15s
#101	GLM 5.2 none	Z.ai	1	6.6	$0.124	12/22	9.34s
Tests totaux 22 Tests incorrects 10 Coût total $0.124 Temps de réponse (moy.) 9.34s
#31	Gemini 3.5 Flash-Lite high	Google	1	8.1	$0.584	14/22	9.48s
Tests totaux 22 Tests incorrects 8 Coût total $0.584 Temps de réponse (moy.) 9.48s
#196	Qwen3 Coder Next medium	Qwen	3	4.7	$0.032	4/22	9.61s
Tests totaux 22 Tests incorrects 18 Coût total $0.032 Temps de réponse (moy.) 9.61s
#190	Grok 4.20 Multi Agent Beta medium	X AI	2	4.8	$5.599	8/18	9.69s
Tests totaux 18 Tests incorrects 10 Coût total $5.599 Temps de réponse (moy.) 9.69s
#137	Grok 4.20 Beta medium	X AI	1	6.0	$0.750	14/18	9.75s
Tests totaux 18 Tests incorrects 4 Coût total $0.750 Temps de réponse (moy.) 9.75s
#154	Owl Alpha none	Openrouter	3	5.6	$0.000	7/21	9.88s
Tests totaux 21 Tests incorrects 14 Coût total $0.000 Temps de réponse (moy.) 9.88s
#165	KAT-Coder-Air V2.5 low	Kwaipilot	2	5.4	$0.041	7/22	10.1s
Tests totaux 22 Tests incorrects 15 Coût total $0.041 Temps de réponse (moy.) 10.1s

Échecs N'a pas suivi les instructions

Filtrer les modèles

Meilleurs modèles par Nombre de N'a pas suivi les instructions

Nombre de N'a pas suivi les instructions vs Score

Meilleurs modèles par Temps de réponse (moy.)