Classement des échecs pour N'a pas suivi les instructions

Voyez quels modèles d'IA rencontrent le plus souvent N'a pas suivi les instructions, pour repérer les risques de fiabilité avant de choisir. Trier par: Nombre d'échecs ↑.

Modèles affichés

Échecs totaux

245

Modèle le plus touché

Gemini 3.5 Flash 1

Catégories

Dans la catégorie Résolution d'énigmes90 Dans la catégorie Intelligence générale78 Dans la catégorie Astuces anti-IA33 Dans la catégorie Suivi des instructions18 Dans la catégorie Programmation16 Dans la catégorie Appel d'outils8 Dans la catégorie Combiné1 Dans la catégorie Spécifique au domaine1

140/140

Rang	Modèle	Entreprise	Nombre de N'a pas suivi les instructions	Score	Coût total	Tests corrects	Temps de réponse (moy.)
#65	Gemini 3.1 Flash Lite medium	Google	1	7.3	$0.117	13/22	4.27s
Tests totaux 22 Tests incorrects 9 Coût total $0.117 Temps de réponse (moy.) 4.27s
#66	Claude Opus 4.8 none	Anthropic	1	7.3	$1.166	13/22	4.91s
Tests totaux 22 Tests incorrects 9 Coût total $1.166 Temps de réponse (moy.) 4.91s
#71	Qwen3.7 Plus none	Qwen	1	7.2	$0.106	11/22	12.1s
Tests totaux 22 Tests incorrects 11 Coût total $0.106 Temps de réponse (moy.) 12.1s
#76	DeepSeek V3.2 medium	DeepSeek	1	7.0	$0.078	11/22	68.6s
Tests totaux 22 Tests incorrects 11 Coût total $0.078 Temps de réponse (moy.) 68.6s
#80	Seed-2.0-Mini medium	Bytedance Seed	1	7.0	$0.101	11/22	92.5s
Tests totaux 22 Tests incorrects 11 Coût total $0.101 Temps de réponse (moy.) 92.5s
#81	KAT-Coder-Pro V2.5 medium	Kwaipilot	1	6.9	$0.467	11/22	24.0s
Tests totaux 22 Tests incorrects 11 Coût total $0.467 Temps de réponse (moy.) 24.0s
#83	GPT-5.6 Sol none	OpenAI	1	6.9	$0.524	11/22	2.16s
Tests totaux 22 Tests incorrects 11 Coût total $0.524 Temps de réponse (moy.) 2.16s
#85	Qwen3.6 Flash medium	Qwen	1	6.9	$0.738	12/22	44.7s
Tests totaux 22 Tests incorrects 10 Coût total $0.738 Temps de réponse (moy.) 44.7s
#88	Gemini 3.5 Flash minimal	Google	1	6.8	$0.300	14/22	2.65s
Tests totaux 22 Tests incorrects 8 Coût total $0.300 Temps de réponse (moy.) 2.65s
#90	Qwen3.6 35B A3B medium	Qwen	1	6.7	$0.746	13/22	58.1s
Tests totaux 22 Tests incorrects 9 Coût total $0.746 Temps de réponse (moy.) 58.1s
#91	LongCat 2.0 low	Meituan	1	6.7	$0.391	10/22	100.3s
Tests totaux 22 Tests incorrects 12 Coût total $0.391 Temps de réponse (moy.) 100.3s
#93	GLM 5V Turbo medium	Z.ai	1	6.7	$0.457	11/21	23.1s
Tests totaux 21 Tests incorrects 10 Coût total $0.457 Temps de réponse (moy.) 23.1s
#96	GLM 5.2 none	Z.ai	1	6.6	$0.151	12/22	9.34s
Tests totaux 22 Tests incorrects 10 Coût total $0.151 Temps de réponse (moy.) 9.34s
#99	Qwen3.6 27B medium	Qwen	1	6.5	$0.779	10/22	106.3s
Tests totaux 22 Tests incorrects 12 Coût total $0.779 Temps de réponse (moy.) 106.3s
#100	Hy3 preview medium	Tencent	1	6.5	$0.018	14/21	16.3s
Tests totaux 21 Tests incorrects 7 Coût total $0.018 Temps de réponse (moy.) 16.3s

Échecs N'a pas suivi les instructions

Filtrer les modèles

Meilleurs modèles par Nombre de N'a pas suivi les instructions

Nombre de N'a pas suivi les instructions vs Score

Meilleurs modèles par Temps de réponse (moy.)