Classement des échecs pour N'a pas suivi les instructions

Voyez quels modèles d'IA rencontrent le plus souvent N'a pas suivi les instructions, pour repérer les risques de fiabilité avant de choisir. Trier par: Score ↑.

Modèles affichés

Échecs totaux

246

Modèle le plus touché

LFM2-24B-A2B 1

Catégories

Dans la catégorie Résolution d'énigmes90 Dans la catégorie Intelligence générale78 Dans la catégorie Astuces anti-IA33 Dans la catégorie Suivi des instructions19 Dans la catégorie Programmation16 Dans la catégorie Appel d'outils8 Dans la catégorie Combiné1 Dans la catégorie Spécifique au domaine1

141/141

Rang	Modèle	Entreprise	Nombre de N'a pas suivi les instructions	Score	Coût total	Tests corrects	Temps de réponse (moy.)
#145	GPT-5.4 none	OpenAI	1	5.8	$0.397	7/22	2.07s
Tests totaux 22 Tests incorrects 15 Coût total $0.397 Temps de réponse (moy.) 2.07s
#144	Kimi K2.6 none	Moonshot AI	3	5.8	$0.184	7/22	19.6s
Tests totaux 22 Tests incorrects 15 Coût total $0.184 Temps de réponse (moy.) 19.6s
#142	GPT-5.4 Mini none	OpenAI	3	5.9	$0.095	6/22	1.53s
Tests totaux 22 Tests incorrects 16 Coût total $0.095 Temps de réponse (moy.) 1.53s
#140	Mimo V2 Omni medium	Xiaomi	2	5.9	$0.683	10/21	41.2s
Tests totaux 21 Tests incorrects 11 Coût total $0.683 Temps de réponse (moy.) 41.2s
#138	GPT-5.6 Terra none	OpenAI	1	6.0	$0.349	8/22	1.65s
Tests totaux 22 Tests incorrects 14 Coût total $0.349 Temps de réponse (moy.) 1.65s
#137	Grok 4.20 Beta medium	X AI	1	6.0	$0.750	14/18	9.75s
Tests totaux 18 Tests incorrects 4 Coût total $0.750 Temps de réponse (moy.) 9.75s
#136	Step 3.5 Flash medium	Stepfun	3	6.0	$0.108	11/21	174.2s
Tests totaux 21 Tests incorrects 10 Coût total $0.108 Temps de réponse (moy.) 174.2s
#135	Nemotron 3 Ultra none	NVIDIA	1	6.1	$0.095	8/22	3.87s
Tests totaux 22 Tests incorrects 14 Coût total $0.095 Temps de réponse (moy.) 3.87s
#134	GPT-5 Nano medium	OpenAI	2	6.1	$0.114	9/22	54.9s
Tests totaux 22 Tests incorrects 13 Coût total $0.114 Temps de réponse (moy.) 54.9s
#133	Qwen3.5-35B-A3B none	Qwen	2	6.1	$0.106	7/22	12.7s
Tests totaux 22 Tests incorrects 15 Coût total $0.106 Temps de réponse (moy.) 12.7s
#132	Qwen3.5 Plus 2026-04-20 none	Qwen	2	6.1	$0.122	8/22	13.6s
Tests totaux 22 Tests incorrects 14 Coût total $0.122 Temps de réponse (moy.) 13.6s
#130	Qwen3.6 Flash none	Qwen	1	6.1	$0.062	7/22	3.74s
Tests totaux 22 Tests incorrects 15 Coût total $0.062 Temps de réponse (moy.) 3.74s
#129	Inkling low	Thinkingmachines	2	6.1	$0.187	10/22	5.15s
Tests totaux 22 Tests incorrects 12 Coût total $0.187 Temps de réponse (moy.) 5.15s
#128	Gemini 3.1 Flash Lite none	Google	1	6.1	$0.046	9/22	1.75s
Tests totaux 22 Tests incorrects 13 Coût total $0.046 Temps de réponse (moy.) 1.75s
#127	gpt-oss-120b medium	OpenAI	3	6.1	$0.019	9/22	21.9s
Tests totaux 22 Tests incorrects 13 Coût total $0.019 Temps de réponse (moy.) 21.9s

Échecs N'a pas suivi les instructions

Filtrer les modèles

Meilleurs modèles par Nombre de N'a pas suivi les instructions

Nombre de N'a pas suivi les instructions vs Score

Meilleurs modèles par Temps de réponse (moy.)