Classement des échecs pour N'a pas suivi les instructions

Voyez quels modèles d'IA rencontrent le plus souvent N'a pas suivi les instructions, pour repérer les risques de fiabilité avant de choisir.

Modèles affichés

Échecs totaux

245

Modèle le plus touché

MiniMax M2.7 5

Catégories

Dans la catégorie Résolution d'énigmes90 Dans la catégorie Intelligence générale78 Dans la catégorie Astuces anti-IA33 Dans la catégorie Suivi des instructions18 Dans la catégorie Programmation16 Dans la catégorie Appel d'outils8 Dans la catégorie Combiné1 Dans la catégorie Spécifique au domaine1

140/140

Rang	Modèle	Entreprise	Nombre de N'a pas suivi les instructions	Score	Coût total	Tests corrects	Temps de réponse (moy.)
#46	DeepSeek V4 Pro high	DeepSeek	2	7.7	$0.200	10/22	79.1s
Tests totaux 22 Tests incorrects 12 Coût total $0.200 Temps de réponse (moy.) 79.1s
#47	MiniMax M3 medium	Minimax	2	7.6	$0.286	12/22	75.0s
Tests totaux 22 Tests incorrects 10 Coût total $0.286 Temps de réponse (moy.) 75.0s
#53	GPT-5.4 Nano medium	OpenAI	2	7.5	$0.138	12/22	13.2s
Tests totaux 22 Tests incorrects 10 Coût total $0.138 Temps de réponse (moy.) 13.2s
#54	GPT-5.3 Chat none	OpenAI	2	7.5	$0.571	13/22	6.88s
Tests totaux 22 Tests incorrects 9 Coût total $0.571 Temps de réponse (moy.) 6.88s
#58	Qwen3.5-27B medium	Qwen	2	7.4	$1.627	13/22	111.9s
Tests totaux 22 Tests incorrects 9 Coût total $1.627 Temps de réponse (moy.) 111.9s
#68	Kimi K2.6 medium	Moonshot AI	2	7.2	$1.036	12/22	110.0s
Tests totaux 22 Tests incorrects 10 Coût total $1.036 Temps de réponse (moy.) 110.0s
#73	Grok 4.3 medium	X AI	2	7.1	$0.779	13/22	47.4s
Tests totaux 22 Tests incorrects 9 Coût total $0.779 Temps de réponse (moy.) 47.4s
#75	Grok 4.20 medium	X AI	2	7.1	$0.777	12/22	29.5s
Tests totaux 22 Tests incorrects 10 Coût total $0.777 Temps de réponse (moy.) 29.5s
#77	Kimi K2.5 medium	Moonshot AI	2	7.0	$0.600	10/22	99.0s
Tests totaux 22 Tests incorrects 12 Coût total $0.600 Temps de réponse (moy.) 99.0s
#82	DeepSeek V4 Pro none	DeepSeek	2	6.9	$0.096	10/22	11.6s
Tests totaux 22 Tests incorrects 12 Coût total $0.096 Temps de réponse (moy.) 11.6s
#84	MiMo-V2.5-Pro medium	Xiaomi	2	6.9	$0.187	12/22	33.9s
Tests totaux 22 Tests incorrects 10 Coût total $0.187 Temps de réponse (moy.) 33.9s
#97	LongCat 2.0 high	Meituan	2	6.6	$0.469	9/22	148.7s
Tests totaux 22 Tests incorrects 13 Coût total $0.469 Temps de réponse (moy.) 148.7s
#103	Qwen3.5-27B none	Qwen	2	6.5	$0.090	8/22	4.76s
Tests totaux 22 Tests incorrects 14 Coût total $0.090 Temps de réponse (moy.) 4.76s
#106	Gemini 3.1 Flash Lite Preview none	Google	2	6.4	$0.052	12/22	1.58s
Tests totaux 22 Tests incorrects 10 Coût total $0.052 Temps de réponse (moy.) 1.58s
#108	Ring-2.6-1T medium	Inclusionai	2	6.3	$0.103	11/22	68.7s
Tests totaux 22 Tests incorrects 11 Coût total $0.103 Temps de réponse (moy.) 68.7s

Échecs N'a pas suivi les instructions

Filtrer les modèles

Meilleurs modèles par Nombre de N'a pas suivi les instructions

Nombre de N'a pas suivi les instructions vs Score

Meilleurs modèles par Temps de réponse (moy.)