Classement des échecs pour N'a pas suivi les instructions

Voyez quels modèles d'IA rencontrent le plus souvent N'a pas suivi les instructions, pour repérer les risques de fiabilité avant de choisir. Trier par: Score ↑.

Modèles affichés

Échecs totaux

246

Modèle le plus touché

LFM2-24B-A2B 1

Catégories

Dans la catégorie Résolution d'énigmes90 Dans la catégorie Intelligence générale78 Dans la catégorie Astuces anti-IA33 Dans la catégorie Suivi des instructions19 Dans la catégorie Programmation16 Dans la catégorie Appel d'outils8 Dans la catégorie Combiné1 Dans la catégorie Spécifique au domaine1

141/141

Rang	Modèle	Entreprise	Nombre de N'a pas suivi les instructions	Score	Coût total	Tests corrects	Temps de réponse (moy.)
#101	GLM 5.2 none	Z.ai	1	6.6	$0.128	12/22	9.34s
Tests totaux 22 Tests incorrects 10 Coût total $0.128 Temps de réponse (moy.) 9.34s
#98	GLM 5V Turbo medium	Z.ai	1	6.7	$0.457	11/21	23.1s
Tests totaux 21 Tests incorrects 10 Coût total $0.457 Temps de réponse (moy.) 23.1s
#96	LongCat 2.0 low	Meituan	1	6.7	$0.391	10/22	100.3s
Tests totaux 22 Tests incorrects 12 Coût total $0.391 Temps de réponse (moy.) 100.3s
#94	Qwen3.6 35B A3B medium	Qwen	1	6.7	$0.746	13/22	58.1s
Tests totaux 22 Tests incorrects 9 Coût total $0.746 Temps de réponse (moy.) 58.1s
#92	Gemini 3.5 Flash minimal	Google	1	6.8	$0.300	14/22	2.65s
Tests totaux 22 Tests incorrects 8 Coût total $0.300 Temps de réponse (moy.) 2.65s
#89	Qwen3.6 Flash medium	Qwen	1	6.9	$0.738	12/22	44.7s
Tests totaux 22 Tests incorrects 10 Coût total $0.738 Temps de réponse (moy.) 44.7s
#88	MiMo-V2.5-Pro medium	Xiaomi	2	6.9	$0.187	12/22	33.9s
Tests totaux 22 Tests incorrects 10 Coût total $0.187 Temps de réponse (moy.) 33.9s
#87	GPT-5.6 Sol none	OpenAI	1	6.9	$0.524	11/22	2.16s
Tests totaux 22 Tests incorrects 11 Coût total $0.524 Temps de réponse (moy.) 2.16s
#86	DeepSeek V4 Pro none	DeepSeek	2	6.9	$0.096	10/22	11.6s
Tests totaux 22 Tests incorrects 12 Coût total $0.096 Temps de réponse (moy.) 11.6s
#85	KAT-Coder-Pro V2.5 medium	Kwaipilot	1	6.9	$0.467	11/22	24.0s
Tests totaux 22 Tests incorrects 11 Coût total $0.467 Temps de réponse (moy.) 24.0s
#84	Seed-2.0-Mini medium	Bytedance Seed	1	7.0	$0.101	11/22	92.5s
Tests totaux 22 Tests incorrects 11 Coût total $0.101 Temps de réponse (moy.) 92.5s
#82	Mercury 2 medium	Inception	3	7.0	$0.093	10/22	2.72s
Tests totaux 22 Tests incorrects 12 Coût total $0.093 Temps de réponse (moy.) 2.72s
#81	Kimi K2.5 medium	Moonshot AI	2	7.0	$0.600	10/22	99.0s
Tests totaux 22 Tests incorrects 12 Coût total $0.600 Temps de réponse (moy.) 99.0s
#80	DeepSeek V3.2 medium	DeepSeek	1	7.0	$0.078	11/22	68.6s
Tests totaux 22 Tests incorrects 11 Coût total $0.078 Temps de réponse (moy.) 68.6s
#79	Grok 4.20 medium	X AI	2	7.1	$0.777	12/22	29.5s
Tests totaux 22 Tests incorrects 10 Coût total $0.777 Temps de réponse (moy.) 29.5s

Échecs N'a pas suivi les instructions

Filtrer les modèles

Meilleurs modèles par Nombre de N'a pas suivi les instructions

Nombre de N'a pas suivi les instructions vs Score

Meilleurs modèles par Temps de réponse (moy.)