Classement des échecs pour Appel d'outil invalide

Voyez quels modèles d'IA rencontrent le plus souvent Appel d'outil invalide, pour repérer les risques de fiabilité avant de choisir. Trier par: Tests corrects ↓.

Modèles affichés

Échecs totaux

100

Modèle le plus touché

Gemini 3.5 Flash 1

Catégories

Dans la catégorie Combiné91 Dans la catégorie Appel d'outils9

83/83

Rang	Modèle	Entreprise	Nombre de Appel d'outil invalide	Score	Coût total	Tests corrects	Temps de réponse (moy.)
#110	Gemma 4 31B medium	Google	1	6.3	$0.163	14/22	75.4s
Tests totaux 22 Tests incorrects 8 Coût total $0.163 Temps de réponse (moy.) 75.4s
#24	Muse Spark 1.1 low	Meta	1	8.3	$0.647	13/22	11.5s
Tests totaux 22 Tests incorrects 9 Coût total $0.647 Temps de réponse (moy.) 11.5s
#45	DeepSeek V4 Flash high	DeepSeek	1	7.7	$0.042	13/22	49.7s
Tests totaux 22 Tests incorrects 9 Coût total $0.042 Temps de réponse (moy.) 49.7s
#51	Nemotron 3 Ultra medium	NVIDIA	1	7.5	$0.774	13/22	32.2s
Tests totaux 22 Tests incorrects 9 Coût total $0.774 Temps de réponse (moy.) 32.2s
#55	GPT-5.6 Terra low	OpenAI	1	7.5	$0.519	13/22	5.31s
Tests totaux 22 Tests incorrects 9 Coût total $0.519 Temps de réponse (moy.) 5.31s
#58	Qwen3.5-27B medium	Qwen	1	7.4	$1.627	13/22	111.9s
Tests totaux 22 Tests incorrects 9 Coût total $1.627 Temps de réponse (moy.) 111.9s
#64	Gemini 3.1 Flash Lite Preview medium	Google	1	7.3	$0.115	13/22	4.61s
Tests totaux 22 Tests incorrects 9 Coût total $0.115 Temps de réponse (moy.) 4.61s
#65	Gemini 3.1 Flash Lite medium	Google	1	7.3	$0.117	13/22	4.27s
Tests totaux 22 Tests incorrects 9 Coût total $0.117 Temps de réponse (moy.) 4.27s
#90	Qwen3.6 35B A3B medium	Qwen	1	6.7	$0.746	13/22	58.1s
Tests totaux 22 Tests incorrects 9 Coût total $0.746 Temps de réponse (moy.) 58.1s
#104	Gemini 3.1 Flash Lite Preview low	Google	1	6.5	$0.646	13/22	16.7s
Tests totaux 22 Tests incorrects 9 Coût total $0.646 Temps de réponse (moy.) 16.7s
#27	Muse Spark 1.1 high	Meta	2	8.1	$1.694	12/22	31.5s
Tests totaux 22 Tests incorrects 10 Coût total $1.694 Temps de réponse (moy.) 31.5s
#56	GPT-5.4 Mini medium	OpenAI	1	7.5	$0.756	12/22	25.9s
Tests totaux 22 Tests incorrects 10 Coût total $0.756 Temps de réponse (moy.) 25.9s
#67	Step 3.7 Flash low	Stepfun	1	7.3	$0.454	12/22	20.7s
Tests totaux 22 Tests incorrects 10 Coût total $0.454 Temps de réponse (moy.) 20.7s
#68	Kimi K2.6 medium	Moonshot AI	1	7.2	$1.036	12/22	110.0s
Tests totaux 22 Tests incorrects 10 Coût total $1.036 Temps de réponse (moy.) 110.0s
#75	Grok 4.20 medium	X AI	1	7.1	$0.777	12/22	29.5s
Tests totaux 22 Tests incorrects 10 Coût total $0.777 Temps de réponse (moy.) 29.5s

←

1 2 3 4 5 6

→

Échecs Appel d'outil invalide

Filtrer les modèles

Meilleurs modèles par Nombre de Appel d'outil invalide

Nombre de Appel d'outil invalide vs Score

Meilleurs modèles par Temps de réponse (moy.)