Classement des échecs pour N'a pas suivi les instructions

Voyez quels modèles d'IA rencontrent le plus souvent N'a pas suivi les instructions, pour repérer les risques de fiabilité avant de choisir. Trier par: Tests corrects ↑.

Modèles affichés

Échecs totaux

246

Modèle le plus touché

Granite 4.1 8B 4

Catégories

Dans la catégorie Résolution d'énigmes90 Dans la catégorie Intelligence générale78 Dans la catégorie Astuces anti-IA33 Dans la catégorie Suivi des instructions19 Dans la catégorie Programmation16 Dans la catégorie Appel d'outils8 Dans la catégorie Combiné1 Dans la catégorie Spécifique au domaine1

141/141

Rang	Modèle	Entreprise	Nombre de N'a pas suivi les instructions	Score	Coût total	Tests corrects	Temps de réponse (moy.)
#152	Owl Alpha medium	Openrouter	2	5.6	$0.000	8/21	11.9s
Tests totaux 21 Tests incorrects 13 Coût total $0.000 Temps de réponse (moy.) 11.9s
#163	Mimo V2 Omni none	Xiaomi	1	5.5	$0.021	8/21	2.44s
Tests totaux 21 Tests incorrects 13 Coût total $0.021 Temps de réponse (moy.) 2.44s
#102	LongCat 2.0 high	Meituan	2	6.6	$0.469	9/22	148.7s
Tests totaux 22 Tests incorrects 13 Coût total $0.469 Temps de réponse (moy.) 148.7s
#127	gpt-oss-120b medium	OpenAI	3	6.1	$0.019	9/22	21.9s
Tests totaux 22 Tests incorrects 13 Coût total $0.019 Temps de réponse (moy.) 21.9s
#128	Gemini 3.1 Flash Lite none	Google	1	6.1	$0.046	9/22	1.75s
Tests totaux 22 Tests incorrects 13 Coût total $0.046 Temps de réponse (moy.) 1.75s
#134	GPT-5 Nano medium	OpenAI	2	6.1	$0.114	9/22	54.9s
Tests totaux 22 Tests incorrects 13 Coût total $0.114 Temps de réponse (moy.) 54.9s
#185	Ring-2.6-1T none	Inclusionai	2	4.8	$0.026	9/22	55.1s
Tests totaux 22 Tests incorrects 13 Coût total $0.026 Temps de réponse (moy.) 55.1s
#187	Grok 4.20 Multi Agent Beta medium	X AI	2	4.8	$5.599	8/18	9.69s
Tests totaux 18 Tests incorrects 10 Coût total $5.599 Temps de réponse (moy.) 9.69s
#190	Hunter Alpha medium	OpenRouter	2	4.7	$0.000	8/18	10.3s
Tests totaux 18 Tests incorrects 10 Coût total $0.000 Temps de réponse (moy.) 10.3s
#50	DeepSeek V4 Pro high	DeepSeek	2	7.7	$0.200	10/22	79.1s
Tests totaux 22 Tests incorrects 12 Coût total $0.200 Temps de réponse (moy.) 79.1s
#81	Kimi K2.5 medium	Moonshot AI	2	7.0	$0.600	10/22	99.0s
Tests totaux 22 Tests incorrects 12 Coût total $0.600 Temps de réponse (moy.) 99.0s
#82	Mercury 2 medium	Inception	3	7.0	$0.093	10/22	2.72s
Tests totaux 22 Tests incorrects 12 Coût total $0.093 Temps de réponse (moy.) 2.72s
#86	DeepSeek V4 Pro none	DeepSeek	2	6.9	$0.096	10/22	11.6s
Tests totaux 22 Tests incorrects 12 Coût total $0.096 Temps de réponse (moy.) 11.6s
#96	LongCat 2.0 low	Meituan	1	6.7	$0.391	10/22	100.3s
Tests totaux 22 Tests incorrects 12 Coût total $0.391 Temps de réponse (moy.) 100.3s
#105	Qwen3.6 27B medium	Qwen	1	6.5	$0.779	10/22	106.3s
Tests totaux 22 Tests incorrects 12 Coût total $0.779 Temps de réponse (moy.) 106.3s

Échecs N'a pas suivi les instructions

Filtrer les modèles

Meilleurs modèles par Nombre de N'a pas suivi les instructions

Nombre de N'a pas suivi les instructions vs Score

Meilleurs modèles par Temps de réponse (moy.)