Classement des échecs pour Mauvaise réponse

Voyez quels modèles d'IA rencontrent le plus souvent Mauvaise réponse, pour repérer les risques de fiabilité avant de choisir.

Modèles affichés

Échecs totaux

1585

Modèle le plus touché

Mercury 2 17

Catégories

Dans la catégorie Spécifique au domaine421 Dans la catégorie Astuces anti-IA293 Dans la catégorie Programmation259 Dans la catégorie Résolution d'énigmes204 Dans la catégorie Culture générale172 Dans la catégorie Combiné69 Dans la catégorie Intelligence générale62 Dans la catégorie Suivi des instructions61 Dans la catégorie Analyse et extraction des données41 Dans la catégorie Appel d'outils3

215/215

Rang	Modèle	Entreprise	Nombre de Mauvaise réponse	Score	Coût total	Tests corrects	Temps de réponse (moy.)
#199	Elephant Alpha none	Openrouter	9	4.3	$0.000	5/21	1.22s
Tests totaux 21 Tests incorrects 16 Coût total $0.000 Temps de réponse (moy.) 1.22s
#200	GLM 4.7 Flash medium	Z.ai	9	4.3	$0.166	4/22	142.6s
Tests totaux 22 Tests incorrects 18 Coût total $0.166 Temps de réponse (moy.) 142.6s
#201	Elephant Alpha medium	Openrouter	9	4.3	$0.000	6/21	1.27s
Tests totaux 21 Tests incorrects 15 Coût total $0.000 Temps de réponse (moy.) 1.27s
#202	Hunter Alpha none	OpenRouter	9	4.2	$0.000	6/18	4.70s
Tests totaux 18 Tests incorrects 12 Coût total $0.000 Temps de réponse (moy.) 4.70s
#214	Nemotron 3 Nano Omni 30b A3b Reasoning none	NVIDIA	9	3.2	$0.000	2/19	728ms
Tests totaux 19 Tests incorrects 17 Coût total $0.000 Temps de réponse (moy.) 728ms
#216	LFM2-24B-A2B none	Liquid	9	2.2	$0.001	2/16	782ms
Tests totaux 16 Tests incorrects 14 Coût total $0.001 Temps de réponse (moy.) 782ms
#43	GPT-5.6 Terra medium	OpenAI	8	7.8	$0.676	14/22	7.11s
Tests totaux 22 Tests incorrects 8 Coût total $0.676 Temps de réponse (moy.) 7.11s
#54	GPT-5.6 Luna medium	OpenAI	8	7.6	$0.352	14/22	7.28s
Tests totaux 22 Tests incorrects 8 Coût total $0.352 Temps de réponse (moy.) 7.28s
#57	GPT-5.4 Nano medium	OpenAI	8	7.5	$0.138	12/22	13.2s
Tests totaux 22 Tests incorrects 10 Coût total $0.138 Temps de réponse (moy.) 13.2s
#59	GPT-5.6 Terra low	OpenAI	8	7.5	$0.519	13/22	5.31s
Tests totaux 22 Tests incorrects 9 Coût total $0.519 Temps de réponse (moy.) 5.31s
#71	Step 3.7 Flash low	Stepfun	8	7.3	$0.454	12/22	20.7s
Tests totaux 22 Tests incorrects 10 Coût total $0.454 Temps de réponse (moy.) 20.7s
#74	Qwen3.5 Plus 2026-04-20 medium	Qwen	8	7.2	$0.317	13/22	46.4s
Tests totaux 22 Tests incorrects 9 Coût total $0.317 Temps de réponse (moy.) 46.4s
#82	Mercury 2 medium	Inception	8	7.0	$0.093	10/22	2.72s
Tests totaux 22 Tests incorrects 12 Coût total $0.093 Temps de réponse (moy.) 2.72s
#86	DeepSeek V4 Pro none	DeepSeek	8	6.9	$0.096	10/22	11.6s
Tests totaux 22 Tests incorrects 12 Coût total $0.096 Temps de réponse (moy.) 11.6s
#89	Qwen3.6 Flash medium	Qwen	8	6.9	$0.738	12/22	44.7s
Tests totaux 22 Tests incorrects 10 Coût total $0.738 Temps de réponse (moy.) 44.7s

Échecs Mauvaise réponse

Filtrer les modèles

Meilleurs modèles par Nombre de Mauvaise réponse

Nombre de Mauvaise réponse vs Score

Meilleurs modèles par Temps de réponse (moy.)