Classement des échecs pour Mauvaise réponse

Voyez quels modèles d'IA rencontrent le plus souvent Mauvaise réponse, pour repérer les risques de fiabilité avant de choisir. Trier par: Nombre d'échecs ↑.

Modèles affichés

Échecs totaux

1558

Modèle le plus touché

Gemini 3 Flash Preview 1

Catégories

Dans la catégorie Spécifique au domaine412 Dans la catégorie Astuces anti-IA293 Dans la catégorie Programmation252 Dans la catégorie Résolution d'énigmes201 Dans la catégorie Culture générale168 Dans la catégorie Combiné68 Dans la catégorie Suivi des instructions61 Dans la catégorie Intelligence générale59 Dans la catégorie Analyse et extraction des données41 Dans la catégorie Appel d'outils3

209/209

Rang	Modèle	Entreprise	Nombre de Mauvaise réponse	Score	Coût total	Tests corrects	Temps de réponse (moy.)
#14	Claude Opus 4.8 medium	Anthropic	3	8.8	$1.931	18/22	12.5s
Tests totaux 22 Tests incorrects 4 Coût total $1.931 Temps de réponse (moy.) 12.5s
#15	Claude Opus 4.7 medium	Anthropic	3	8.7	$1.477	18/22	7.61s
Tests totaux 22 Tests incorrects 4 Coût total $1.477 Temps de réponse (moy.) 7.61s
#21	GPT-5.2 medium	OpenAI	3	8.4	$0.951	14/22	22.6s
Tests totaux 22 Tests incorrects 8 Coût total $0.951 Temps de réponse (moy.) 22.6s
#31	GLM 5.2 high	Z.ai	3	8.0	$0.970	14/22	62.7s
Tests totaux 22 Tests incorrects 8 Coût total $0.970 Temps de réponse (moy.) 62.7s
#38	GLM 5.2 medium	Z.ai	3	7.8	$0.222	15/21	23.3s
Tests totaux 21 Tests incorrects 6 Coût total $0.222 Temps de réponse (moy.) 23.3s
#42	GLM 5 medium	Z.ai	3	7.7	$0.307	15/21	33.5s
Tests totaux 21 Tests incorrects 6 Coût total $0.307 Temps de réponse (moy.) 33.5s
#43	Claude Opus 4.6 medium	Anthropic	3	7.7	$3.059	13/22	34.3s
Tests totaux 22 Tests incorrects 9 Coût total $3.059 Temps de réponse (moy.) 34.3s
#47	MiniMax M3 medium	Minimax	3	7.6	$0.286	12/22	75.0s
Tests totaux 22 Tests incorrects 10 Coût total $0.286 Temps de réponse (moy.) 75.0s
#68	Kimi K2.6 medium	Moonshot AI	3	7.2	$1.036	12/22	110.0s
Tests totaux 22 Tests incorrects 10 Coût total $1.036 Temps de réponse (moy.) 110.0s
#79	Gemini 3.5 Flash none	Google	3	7.0	$1.079	15/22	9.93s
Tests totaux 22 Tests incorrects 7 Coût total $1.079 Temps de réponse (moy.) 9.93s
#84	MiMo-V2.5-Pro medium	Xiaomi	3	6.9	$0.187	12/22	33.9s
Tests totaux 22 Tests incorrects 10 Coût total $0.187 Temps de réponse (moy.) 33.9s
#94	Claude Opus 4.7 none	Anthropic	3	6.6	$0.505	16/19	3.02s
Tests totaux 19 Tests incorrects 3 Coût total $0.505 Temps de réponse (moy.) 3.02s
#95	Gemma 4 26B A4B medium	Google	3	6.6	$0.089	14/22	103.8s
Tests totaux 22 Tests incorrects 8 Coût total $0.089 Temps de réponse (moy.) 103.8s
#100	Hy3 preview medium	Tencent	3	6.5	$0.018	14/21	16.3s
Tests totaux 21 Tests incorrects 7 Coût total $0.018 Temps de réponse (moy.) 16.3s
#131	Grok 4.20 Beta medium	X AI	3	6.0	$0.750	14/18	9.75s
Tests totaux 18 Tests incorrects 4 Coût total $0.750 Temps de réponse (moy.) 9.75s

Échecs Mauvaise réponse

Filtrer les modèles

Meilleurs modèles par Nombre de Mauvaise réponse

Nombre de Mauvaise réponse vs Score

Meilleurs modèles par Temps de réponse (moy.)