Classement des échecs pour Mauvaise réponse

Voyez quels modèles d'IA rencontrent le plus souvent Mauvaise réponse, pour repérer les risques de fiabilité avant de choisir. Trier par: Score ↑.

Modèles affichés

Échecs totaux

1558

Modèle le plus touché

LFM2-24B-A2B 9

Catégories

Dans la catégorie Spécifique au domaine412 Dans la catégorie Astuces anti-IA293 Dans la catégorie Programmation252 Dans la catégorie Résolution d'énigmes201 Dans la catégorie Culture générale168 Dans la catégorie Combiné68 Dans la catégorie Suivi des instructions61 Dans la catégorie Intelligence générale59 Dans la catégorie Analyse et extraction des données41 Dans la catégorie Appel d'outils3

209/209

Rang	Modèle	Entreprise	Nombre de Mauvaise réponse	Score	Coût total	Tests corrects	Temps de réponse (moy.)
#195	Elephant Alpha medium	Openrouter	9	4.3	$0.000	6/21	1.27s
Tests totaux 21 Tests incorrects 15 Coût total $0.000 Temps de réponse (moy.) 1.27s
#194	GLM 4.7 Flash medium	Z.ai	9	4.3	$0.166	4/22	142.6s
Tests totaux 22 Tests incorrects 18 Coût total $0.166 Temps de réponse (moy.) 142.6s
#193	Elephant Alpha none	Openrouter	9	4.3	$0.000	5/21	1.22s
Tests totaux 21 Tests incorrects 16 Coût total $0.000 Temps de réponse (moy.) 1.22s
#192	Laguna M.1 none	Poolside	10	4.4	$0.009	4/19	2.89s
Tests totaux 19 Tests incorrects 15 Coût total $0.009 Temps de réponse (moy.) 2.89s
#191	Grok 4.20 Beta none	X AI	10	4.4	$0.087	6/18	1.19s
Tests totaux 18 Tests incorrects 12 Coût total $0.087 Temps de réponse (moy.) 1.19s
#190	MiniMax M2.5 medium	Minimax	7	4.6	$0.340	5/22	68.3s
Tests totaux 22 Tests incorrects 17 Coût total $0.340 Temps de réponse (moy.) 68.3s
#189	Mercury 2 none	Inception	17	4.6	$0.030	4/22	829ms
Tests totaux 22 Tests incorrects 18 Coût total $0.030 Temps de réponse (moy.) 829ms
#188	Cobuddy medium	Baidu	9	4.7	$0.000	7/21	39.9s
Tests totaux 21 Tests incorrects 14 Coût total $0.000 Temps de réponse (moy.) 39.9s
#187	Qwen3 Coder Next medium	Qwen	13	4.7	$0.032	4/22	9.61s
Tests totaux 22 Tests incorrects 18 Coût total $0.032 Temps de réponse (moy.) 9.61s
#186	Laguna M.1 medium	Poolside	4	4.7	$0.033	9/19	14.7s
Tests totaux 19 Tests incorrects 10 Coût total $0.033 Temps de réponse (moy.) 14.7s
#185	Grok 4.1 Fast medium	X AI	4	4.7	$0.069	9/19	23.8s
Tests totaux 19 Tests incorrects 10 Coût total $0.069 Temps de réponse (moy.) 23.8s
#184	Hunter Alpha medium	OpenRouter	4	4.7	$0.000	8/18	10.3s
Tests totaux 18 Tests incorrects 10 Coût total $0.000 Temps de réponse (moy.) 10.3s
#183	Trinity Large Preview none	Arcee AI	12	4.8	$0.008	4/21	2.98s
Tests totaux 21 Tests incorrects 17 Coût total $0.008 Temps de réponse (moy.) 2.98s
#182	KAT-Coder-Air V2.5 none	Kwaipilot	13	4.8	$0.067	5/22	12.2s
Tests totaux 22 Tests incorrects 17 Coût total $0.067 Temps de réponse (moy.) 12.2s
#181	Grok 4.20 Multi Agent Beta medium	X AI	4	4.8	$5.599	8/18	9.69s
Tests totaux 18 Tests incorrects 10 Coût total $5.599 Temps de réponse (moy.) 9.69s

Échecs Mauvaise réponse

Filtrer les modèles

Meilleurs modèles par Nombre de Mauvaise réponse

Nombre de Mauvaise réponse vs Score

Meilleurs modèles par Temps de réponse (moy.)