Classement des échecs pour Appel d'outil invalide

Voyez quels modèles d'IA rencontrent le plus souvent Appel d'outil invalide, pour repérer les risques de fiabilité avant de choisir. Trier par: Score ↑.

Modèles affichés

Échecs totaux

100

Modèle le plus touché

Laguna Xs.2 1

Catégories

Dans la catégorie Combiné91 Dans la catégorie Appel d'outils9

83/83

Rang	Modèle	Entreprise	Nombre de Appel d'outil invalide	Score	Coût total	Tests corrects	Temps de réponse (moy.)
#205	Laguna Xs.2 none	Poolside	1	3.8	$0.004	5/19	806ms
Tests totaux 19 Tests incorrects 14 Coût total $0.004 Temps de réponse (moy.) 806ms
#201	Granite 4.1 8B none	IBM Granite	2	4.0	$0.007	2/22	1.45s
Tests totaux 22 Tests incorrects 20 Coût total $0.007 Temps de réponse (moy.) 1.45s
#198	Laguna Xs.2 medium	Poolside	1	4.1	$0.015	6/19	6.73s
Tests totaux 19 Tests incorrects 13 Coût total $0.015 Temps de réponse (moy.) 6.73s
#197	Grok 4.20 none	X AI	1	4.1	$0.057	6/18	1.11s
Tests totaux 18 Tests incorrects 12 Coût total $0.057 Temps de réponse (moy.) 1.11s
#195	Elephant Alpha medium	Openrouter	1	4.3	$0.000	6/21	1.27s
Tests totaux 21 Tests incorrects 15 Coût total $0.000 Temps de réponse (moy.) 1.27s
#194	GLM 4.7 Flash medium	Z.ai	2	4.3	$0.166	4/22	142.6s
Tests totaux 22 Tests incorrects 18 Coût total $0.166 Temps de réponse (moy.) 142.6s
#193	Elephant Alpha none	Openrouter	1	4.3	$0.000	5/21	1.22s
Tests totaux 21 Tests incorrects 16 Coût total $0.000 Temps de réponse (moy.) 1.22s
#192	Laguna M.1 none	Poolside	1	4.4	$0.009	4/19	2.89s
Tests totaux 19 Tests incorrects 15 Coût total $0.009 Temps de réponse (moy.) 2.89s
#191	Grok 4.20 Beta none	X AI	1	4.4	$0.087	6/18	1.19s
Tests totaux 18 Tests incorrects 12 Coût total $0.087 Temps de réponse (moy.) 1.19s
#190	MiniMax M2.5 medium	Minimax	1	4.6	$0.340	5/22	68.3s
Tests totaux 22 Tests incorrects 17 Coût total $0.340 Temps de réponse (moy.) 68.3s
#188	Cobuddy medium	Baidu	1	4.7	$0.000	7/21	39.9s
Tests totaux 21 Tests incorrects 14 Coût total $0.000 Temps de réponse (moy.) 39.9s
#178	Ling-2.6-flash none	Inclusionai	3	4.9	$0.002	6/22	10.7s
Tests totaux 22 Tests incorrects 16 Coût total $0.002 Temps de réponse (moy.) 10.7s
#176	GLM 4.7 Flash none	Z.ai	2	4.9	$0.016	6/22	9.15s
Tests totaux 22 Tests incorrects 16 Coût total $0.016 Temps de réponse (moy.) 9.15s
#173	DeepSeek V3.2 none	DeepSeek	2	5.0	$0.054	6/22	18.3s
Tests totaux 22 Tests incorrects 16 Coût total $0.054 Temps de réponse (moy.) 18.3s
#172	MiniMax M2.7 medium	Minimax	1	5.0	$0.163	5/22	41.3s
Tests totaux 22 Tests incorrects 17 Coût total $0.163 Temps de réponse (moy.) 41.3s

1 2 3 4 5 6

→

Échecs Appel d'outil invalide

Filtrer les modèles

Meilleurs modèles par Nombre de Appel d'outil invalide

Nombre de Appel d'outil invalide vs Score

Meilleurs modèles par Temps de réponse (moy.)