Classement des échecs pour Appel d'outil invalide

Voyez quels modèles d'IA rencontrent le plus souvent Appel d'outil invalide, pour repérer les risques de fiabilité avant de choisir. Trier par: Nombre d'échecs ↑.

Modèles affichés

Échecs totaux

100

Modèle le plus touché

Gemini 3.5 Flash 1

Catégories

Dans la catégorie Combiné91 Dans la catégorie Appel d'outils9

83/83

Rang	Modèle	Entreprise	Nombre de Appel d'outil invalide	Score	Coût total	Tests corrects	Temps de réponse (moy.)
#57	Qwen3.5 Plus 2026-02-15 medium	Qwen	1	7.5	$0.437	14/22	89.2s
Tests totaux 22 Tests incorrects 8 Coût total $0.437 Temps de réponse (moy.) 89.2s
#58	Qwen3.5-27B medium	Qwen	1	7.4	$1.627	13/22	111.9s
Tests totaux 22 Tests incorrects 9 Coût total $1.627 Temps de réponse (moy.) 111.9s
#64	Gemini 3.1 Flash Lite Preview medium	Google	1	7.3	$0.115	13/22	4.61s
Tests totaux 22 Tests incorrects 9 Coût total $0.115 Temps de réponse (moy.) 4.61s
#65	Gemini 3.1 Flash Lite medium	Google	1	7.3	$0.117	13/22	4.27s
Tests totaux 22 Tests incorrects 9 Coût total $0.117 Temps de réponse (moy.) 4.27s
#67	Step 3.7 Flash low	Stepfun	1	7.3	$0.454	12/22	20.7s
Tests totaux 22 Tests incorrects 10 Coût total $0.454 Temps de réponse (moy.) 20.7s
#68	Kimi K2.6 medium	Moonshot AI	1	7.2	$1.036	12/22	110.0s
Tests totaux 22 Tests incorrects 10 Coût total $1.036 Temps de réponse (moy.) 110.0s
#69	KAT-Coder-Pro V2.5 high	Kwaipilot	1	7.2	$0.482	11/22	20.8s
Tests totaux 22 Tests incorrects 11 Coût total $0.482 Temps de réponse (moy.) 20.8s
#72	Qwen3.5-122B-A10B medium	Qwen	1	7.1	$1.046	14/22	64.2s
Tests totaux 22 Tests incorrects 8 Coût total $1.046 Temps de réponse (moy.) 64.2s
#75	Grok 4.20 medium	X AI	1	7.1	$0.777	12/22	29.5s
Tests totaux 22 Tests incorrects 10 Coût total $0.777 Temps de réponse (moy.) 29.5s
#76	DeepSeek V3.2 medium	DeepSeek	1	7.0	$0.078	11/22	68.6s
Tests totaux 22 Tests incorrects 11 Coût total $0.078 Temps de réponse (moy.) 68.6s
#77	Kimi K2.5 medium	Moonshot AI	1	7.0	$0.600	10/22	99.0s
Tests totaux 22 Tests incorrects 12 Coût total $0.600 Temps de réponse (moy.) 99.0s
#78	Mercury 2 medium	Inception	1	7.0	$0.093	10/22	2.72s
Tests totaux 22 Tests incorrects 12 Coût total $0.093 Temps de réponse (moy.) 2.72s
#82	DeepSeek V4 Pro none	DeepSeek	1	6.9	$0.096	10/22	11.6s
Tests totaux 22 Tests incorrects 12 Coût total $0.096 Temps de réponse (moy.) 11.6s
#84	MiMo-V2.5-Pro medium	Xiaomi	1	6.9	$0.187	12/22	33.9s
Tests totaux 22 Tests incorrects 10 Coût total $0.187 Temps de réponse (moy.) 33.9s
#85	Qwen3.6 Flash medium	Qwen	1	6.9	$0.738	12/22	44.7s
Tests totaux 22 Tests incorrects 10 Coût total $0.738 Temps de réponse (moy.) 44.7s

←

1 2 3 4 5 6

→

Échecs Appel d'outil invalide

Filtrer les modèles

Meilleurs modèles par Nombre de Appel d'outil invalide

Nombre de Appel d'outil invalide vs Score

Meilleurs modèles par Temps de réponse (moy.)