Classement des échecs pour N'a pas suivi les instructions

Voyez quels modèles d'IA rencontrent le plus souvent N'a pas suivi les instructions, pour repérer les risques de fiabilité avant de choisir. Trier par: Tests corrects ↓.

Modèles affichés

Échecs totaux

246

Modèle le plus touché

Gemini 3.5 Flash 1

Catégories

Dans la catégorie Résolution d'énigmes90 Dans la catégorie Intelligence générale78 Dans la catégorie Astuces anti-IA33 Dans la catégorie Suivi des instructions19 Dans la catégorie Programmation16 Dans la catégorie Appel d'outils8 Dans la catégorie Combiné1 Dans la catégorie Spécifique au domaine1

141/141

Rang	Modèle	Entreprise	Nombre de N'a pas suivi les instructions	Score	Coût total	Tests corrects	Temps de réponse (moy.)
#191	Grok 4.1 Fast medium	X AI	4	4.7	$0.069	9/19	23.8s
Tests totaux 19 Tests incorrects 10 Coût total $0.069 Temps de réponse (moy.) 23.8s
#192	Laguna M.1 medium	Poolside	1	4.7	$0.033	9/19	14.7s
Tests totaux 19 Tests incorrects 10 Coût total $0.033 Temps de réponse (moy.) 14.7s
#50	DeepSeek V4 Pro high	DeepSeek	2	7.7	$0.200	10/22	79.1s
Tests totaux 22 Tests incorrects 12 Coût total $0.200 Temps de réponse (moy.) 79.1s
#81	Kimi K2.5 medium	Moonshot AI	2	7.0	$0.600	10/22	99.0s
Tests totaux 22 Tests incorrects 12 Coût total $0.600 Temps de réponse (moy.) 99.0s
#82	Mercury 2 medium	Inception	3	7.0	$0.093	10/22	2.72s
Tests totaux 22 Tests incorrects 12 Coût total $0.093 Temps de réponse (moy.) 2.72s
#86	DeepSeek V4 Pro none	DeepSeek	2	6.9	$0.096	10/22	11.6s
Tests totaux 22 Tests incorrects 12 Coût total $0.096 Temps de réponse (moy.) 11.6s
#96	LongCat 2.0 low	Meituan	1	6.7	$0.391	10/22	100.3s
Tests totaux 22 Tests incorrects 12 Coût total $0.391 Temps de réponse (moy.) 100.3s
#105	Qwen3.6 27B medium	Qwen	1	6.5	$0.779	10/22	106.3s
Tests totaux 22 Tests incorrects 12 Coût total $0.779 Temps de réponse (moy.) 106.3s
#121	Gemma 4 31B none	Google	1	6.2	$0.021	10/22	5.34s
Tests totaux 22 Tests incorrects 12 Coût total $0.021 Temps de réponse (moy.) 5.34s
#123	GPT-5.6 Luna low	OpenAI	1	6.2	$0.249	10/22	5.04s
Tests totaux 22 Tests incorrects 12 Coût total $0.249 Temps de réponse (moy.) 5.04s
#126	Gemini 3.1 Flash Lite minimal	Google	3	6.1	$0.047	10/22	1.86s
Tests totaux 22 Tests incorrects 12 Coût total $0.047 Temps de réponse (moy.) 1.86s
#129	Inkling low	Thinkingmachines	2	6.1	$0.187	10/22	5.15s
Tests totaux 22 Tests incorrects 12 Coût total $0.187 Temps de réponse (moy.) 5.15s
#187	Grok 4.20 Multi Agent Beta medium	X AI	2	4.8	$5.599	8/18	9.69s
Tests totaux 18 Tests incorrects 10 Coût total $5.599 Temps de réponse (moy.) 9.69s
#190	Hunter Alpha medium	OpenRouter	2	4.7	$0.000	8/18	10.3s
Tests totaux 18 Tests incorrects 10 Coût total $0.000 Temps de réponse (moy.) 10.3s
#102	LongCat 2.0 high	Meituan	2	6.6	$0.469	9/22	148.7s
Tests totaux 22 Tests incorrects 13 Coût total $0.469 Temps de réponse (moy.) 148.7s

Échecs N'a pas suivi les instructions

Filtrer les modèles

Meilleurs modèles par Nombre de N'a pas suivi les instructions

Nombre de N'a pas suivi les instructions vs Score

Meilleurs modèles par Temps de réponse (moy.)