Classement des échecs pour N'a pas suivi les instructions

Voyez quels modèles d'IA rencontrent le plus souvent N'a pas suivi les instructions, pour repérer les risques de fiabilité avant de choisir.

Modèles affichés

Échecs totaux

242

Modèle le plus touché

MiniMax M2.7 5

Catégories

Dans la catégorie Résolution d'énigmes88 Dans la catégorie Intelligence générale78 Dans la catégorie Astuces anti-IA32 Dans la catégorie Suivi des instructions18 Dans la catégorie Programmation16 Dans la catégorie Appel d'outils8 Dans la catégorie Combiné1 Dans la catégorie Spécifique au domaine1

138/138

Rang	Modèle	Entreprise	Nombre de N'a pas suivi les instructions	Score	Coût total	Tests corrects	Temps de réponse (moy.)
#168	MiniMax M2.7 medium	Minimax	5	5.0	$0.163	5/22	41.3s
Tests totaux 22 Tests incorrects 17 Coût total $0.163 Temps de réponse (moy.) 41.3s
#150	MiMo-V2.5-Pro none	Xiaomi	4	5.5	$0.068	6/22	4.12s
Tests totaux 22 Tests incorrects 16 Coût total $0.068 Temps de réponse (moy.) 4.12s
#181	Grok 4.1 Fast medium	X AI	4	4.7	$0.069	9/19	23.8s
Tests totaux 19 Tests incorrects 10 Coût total $0.069 Temps de réponse (moy.) 23.8s
#195	Hy3 preview none	Tencent	4	4.0	$0.003	4/21	12.9s
Tests totaux 21 Tests incorrects 17 Coût total $0.003 Temps de réponse (moy.) 12.9s
#197	Granite 4.1 8B none	IBM Granite	4	4.0	$0.007	2/22	1.45s
Tests totaux 22 Tests incorrects 20 Coût total $0.007 Temps de réponse (moy.) 1.45s
#21	GPT-5.2 medium	OpenAI	3	8.4	$0.951	14/22	22.6s
Tests totaux 22 Tests incorrects 8 Coût total $0.951 Temps de réponse (moy.) 22.6s
#26	GPT-5 Mini medium	OpenAI	3	8.1	$0.237	12/22	27.6s
Tests totaux 22 Tests incorrects 10 Coût total $0.237 Temps de réponse (moy.) 27.6s
#56	GPT-5.4 Mini medium	OpenAI	3	7.5	$0.756	12/22	25.9s
Tests totaux 22 Tests incorrects 10 Coût total $0.756 Temps de réponse (moy.) 25.9s
#77	Mercury 2 medium	Inception	3	7.0	$0.093	10/22	2.72s
Tests totaux 22 Tests incorrects 12 Coût total $0.093 Temps de réponse (moy.) 2.72s
#116	Gemini 3.1 Flash Lite minimal	Google	3	6.1	$0.047	10/22	1.86s
Tests totaux 22 Tests incorrects 12 Coût total $0.047 Temps de réponse (moy.) 1.86s
#117	gpt-oss-120b medium	OpenAI	3	6.1	$0.019	9/22	21.9s
Tests totaux 22 Tests incorrects 13 Coût total $0.019 Temps de réponse (moy.) 21.9s
#126	Step 3.5 Flash medium	Stepfun	3	6.0	$0.108	11/21	174.2s
Tests totaux 21 Tests incorrects 10 Coût total $0.108 Temps de réponse (moy.) 174.2s
#132	GPT-5.4 Mini none	OpenAI	3	5.9	$0.095	6/22	1.53s
Tests totaux 22 Tests incorrects 16 Coût total $0.095 Temps de réponse (moy.) 1.53s
#134	Kimi K2.6 none	Moonshot AI	3	5.8	$0.233	7/22	19.6s
Tests totaux 22 Tests incorrects 15 Coût total $0.233 Temps de réponse (moy.) 19.6s
#136	Nemotron 3 Super medium	NVIDIA	3	5.7	$0.066	8/22	52.0s
Tests totaux 22 Tests incorrects 14 Coût total $0.066 Temps de réponse (moy.) 52.0s

Échecs N'a pas suivi les instructions

Filtrer les modèles

Meilleurs modèles par Nombre de N'a pas suivi les instructions

Nombre de N'a pas suivi les instructions vs Score

Meilleurs modèles par Temps de réponse (moy.)