Classement des échecs pour N'a pas suivi les instructions

Voyez quels modèles d'IA rencontrent le plus souvent N'a pas suivi les instructions, pour repérer les risques de fiabilité avant de choisir. Trier par: Nombre d'échecs ↑.

Modèles affichés

Échecs totaux

246

Modèle le plus touché

Gemini 3.5 Flash 1

Catégories

Dans la catégorie Résolution d'énigmes90 Dans la catégorie Intelligence générale78 Dans la catégorie Astuces anti-IA33 Dans la catégorie Suivi des instructions19 Dans la catégorie Programmation16 Dans la catégorie Appel d'outils8 Dans la catégorie Combiné1 Dans la catégorie Spécifique au domaine1

141/141

Rang	Modèle	Entreprise	Nombre de N'a pas suivi les instructions	Score	Coût total	Tests corrects	Temps de réponse (moy.)
#210	Qwen3.5-9B medium	Qwen	1	3.8	$0.036	3/22	82.2s
Tests totaux 22 Tests incorrects 19 Coût total $0.036 Temps de réponse (moy.) 82.2s
#211	Laguna Xs.2 none	Poolside	1	3.8	$0.004	5/19	806ms
Tests totaux 19 Tests incorrects 14 Coût total $0.004 Temps de réponse (moy.) 806ms
#213	Nemotron 3 Nano Omni 30b A3b Reasoning medium	NVIDIA	1	3.4	$0.000	4/19	17.1s
Tests totaux 19 Tests incorrects 15 Coût total $0.000 Temps de réponse (moy.) 17.1s
#215	Step 3.5 Flash none	Stepfun	1	2.3	$0.020	6/12	39.0s
Tests totaux 12 Tests incorrects 6 Coût total $0.020 Temps de réponse (moy.) 39.0s
#216	LFM2-24B-A2B none	Liquid	1	2.2	$0.001	2/16	782ms
Tests totaux 16 Tests incorrects 14 Coût total $0.001 Temps de réponse (moy.) 782ms
#16	GPT-5.3-Codex medium	OpenAI	2	8.9	$0.920	16/22	17.0s
Tests totaux 22 Tests incorrects 6 Coût total $0.920 Temps de réponse (moy.) 17.0s
#19	Muse Spark 1.1 medium	Meta	2	8.6	$1.357	15/22	25.0s
Tests totaux 22 Tests incorrects 7 Coût total $1.357 Temps de réponse (moy.) 25.0s
#21	GPT-5.4 medium	OpenAI	2	8.5	$1.533	15/22	23.1s
Tests totaux 22 Tests incorrects 7 Coût total $1.533 Temps de réponse (moy.) 23.1s
#27	Muse Spark 1.1 low	Meta	2	8.3	$0.647	13/22	11.5s
Tests totaux 22 Tests incorrects 9 Coût total $0.647 Temps de réponse (moy.) 11.5s
#30	Muse Spark 1.1 high	Meta	2	8.1	$1.694	12/22	31.5s
Tests totaux 22 Tests incorrects 10 Coût total $1.694 Temps de réponse (moy.) 31.5s
#39	Seed-2.0-Lite medium	Bytedance Seed	2	7.9	$0.234	14/22	48.5s
Tests totaux 22 Tests incorrects 8 Coût total $0.234 Temps de réponse (moy.) 48.5s
#49	DeepSeek V4 Flash high	DeepSeek	2	7.7	$0.041	13/22	49.7s
Tests totaux 22 Tests incorrects 9 Coût total $0.041 Temps de réponse (moy.) 49.7s
#50	DeepSeek V4 Pro high	DeepSeek	2	7.7	$0.200	10/22	79.1s
Tests totaux 22 Tests incorrects 12 Coût total $0.200 Temps de réponse (moy.) 79.1s
#51	MiniMax M3 medium	Minimax	2	7.6	$0.286	12/22	75.0s
Tests totaux 22 Tests incorrects 10 Coût total $0.286 Temps de réponse (moy.) 75.0s
#57	GPT-5.4 Nano medium	OpenAI	2	7.5	$0.138	12/22	13.2s
Tests totaux 22 Tests incorrects 10 Coût total $0.138 Temps de réponse (moy.) 13.2s

Échecs N'a pas suivi les instructions

Filtrer les modèles

Meilleurs modèles par Nombre de N'a pas suivi les instructions

Nombre de N'a pas suivi les instructions vs Score

Meilleurs modèles par Temps de réponse (moy.)