Classement des échecs pour N'a pas suivi les instructions

Voyez quels modèles d'IA rencontrent le plus souvent N'a pas suivi les instructions, pour repérer les risques de fiabilité avant de choisir. Trier par: Tests corrects ↑.

Modèles affichés

Échecs totaux

246

Modèle le plus touché

Granite 4.1 8B 4

Catégories

Dans la catégorie Résolution d'énigmes90 Dans la catégorie Intelligence générale78 Dans la catégorie Astuces anti-IA33 Dans la catégorie Suivi des instructions19 Dans la catégorie Programmation16 Dans la catégorie Appel d'outils8 Dans la catégorie Combiné1 Dans la catégorie Spécifique au domaine1

141/141

Rang	Modèle	Entreprise	Nombre de N'a pas suivi les instructions	Score	Coût total	Tests corrects	Temps de réponse (moy.)
#120	Qwen3.5-Flash medium	Qwen	1	6.2	$0.139	12/22	84.8s
Tests totaux 22 Tests incorrects 10 Coût total $0.139 Temps de réponse (moy.) 84.8s
#149	Gemini 3.1 Flash Lite high	Google	3	5.6	$2.044	10/18	62.0s
Tests totaux 18 Tests incorrects 8 Coût total $2.044 Temps de réponse (moy.) 62.0s
#115	Mimo V2 PRO medium	Xiaomi	1	6.3	$0.333	12/21	22.2s
Tests totaux 21 Tests incorrects 9 Coût total $0.333 Temps de réponse (moy.) 22.2s
#119	MiMo-V2-Flash medium	Xiaomi	1	6.3	$0.043	12/21	20.1s
Tests totaux 21 Tests incorrects 9 Coût total $0.043 Temps de réponse (moy.) 20.1s
#27	Muse Spark 1.1 low	Meta	2	8.3	$0.647	13/22	11.5s
Tests totaux 22 Tests incorrects 9 Coût total $0.647 Temps de réponse (moy.) 11.5s
#47	Claude Opus 4.6 medium	Anthropic	1	7.7	$3.059	13/22	34.3s
Tests totaux 22 Tests incorrects 9 Coût total $3.059 Temps de réponse (moy.) 34.3s
#49	DeepSeek V4 Flash high	DeepSeek	2	7.7	$0.041	13/22	49.7s
Tests totaux 22 Tests incorrects 9 Coût total $0.041 Temps de réponse (moy.) 49.7s
#58	GPT-5.3 Chat none	OpenAI	2	7.5	$0.571	13/22	6.88s
Tests totaux 22 Tests incorrects 9 Coût total $0.571 Temps de réponse (moy.) 6.88s
#62	Qwen3.5-27B medium	Qwen	2	7.4	$1.627	13/22	111.9s
Tests totaux 22 Tests incorrects 9 Coût total $1.627 Temps de réponse (moy.) 111.9s
#68	Gemini 3.1 Flash Lite Preview medium	Google	1	7.3	$0.115	13/22	4.61s
Tests totaux 22 Tests incorrects 9 Coût total $0.115 Temps de réponse (moy.) 4.61s
#69	Gemini 3.1 Flash Lite medium	Google	1	7.3	$0.117	13/22	4.27s
Tests totaux 22 Tests incorrects 9 Coût total $0.117 Temps de réponse (moy.) 4.27s
#70	Claude Opus 4.8 none	Anthropic	1	7.3	$1.166	13/22	4.91s
Tests totaux 22 Tests incorrects 9 Coût total $1.166 Temps de réponse (moy.) 4.91s
#77	Grok 4.3 medium	X AI	2	7.1	$0.779	13/22	47.4s
Tests totaux 22 Tests incorrects 9 Coût total $0.779 Temps de réponse (moy.) 47.4s
#94	Qwen3.6 35B A3B medium	Qwen	1	6.7	$0.746	13/22	58.1s
Tests totaux 22 Tests incorrects 9 Coût total $0.746 Temps de réponse (moy.) 58.1s
#110	Gemini 3.1 Flash Lite Preview low	Google	1	6.5	$0.646	13/22	16.7s
Tests totaux 22 Tests incorrects 9 Coût total $0.646 Temps de réponse (moy.) 16.7s

Échecs N'a pas suivi les instructions

Filtrer les modèles

Meilleurs modèles par Nombre de N'a pas suivi les instructions

Nombre de N'a pas suivi les instructions vs Score

Meilleurs modèles par Temps de réponse (moy.)