Classement des échecs pour Mise en forme supplémentaire

Voyez quels modèles d'IA rencontrent le plus souvent Mise en forme supplémentaire, pour repérer les risques de fiabilité avant de choisir. Trier par: Nombre d'échecs ↑.

Modèles affichés

Échecs totaux

Modèle le plus touché

Kimi K3 1

Catégories

Dans la catégorie Astuces anti-IA20 Dans la catégorie Programmation18 Dans la catégorie Spécifique au domaine17 Dans la catégorie Résolution d'énigmes8 Dans la catégorie Analyse et extraction des données6 Dans la catégorie Suivi des instructions3 Dans la catégorie Combiné1

42/42

Rang	Modèle	Entreprise	Nombre de Mise en forme supplémentaire	Score	Coût total	Tests corrects	Temps de réponse (moy.)
#157	Mimo V2 Omni none	Xiaomi	1	5.5	$0.021	8/21	2.44s
Tests totaux 21 Tests incorrects 13 Coût total $0.021 Temps de réponse (moy.) 2.44s
#159	GPT-5.6 Luna none	OpenAI	1	5.4	$0.142	6/22	1.50s
Tests totaux 22 Tests incorrects 16 Coût total $0.142 Temps de réponse (moy.) 1.50s
#164	Inkling none	Thinkingmachines	1	5.2	$0.147	6/22	3.50s
Tests totaux 22 Tests incorrects 16 Coût total $0.147 Temps de réponse (moy.) 3.50s
#166	Qwen3 Coder Next none	Qwen	1	5.1	$0.025	5/22	9.12s
Tests totaux 22 Tests incorrects 17 Coût total $0.025 Temps de réponse (moy.) 9.12s
#168	MiMo-V2.5 none	Xiaomi	1	5.1	$0.025	5/22	4.62s
Tests totaux 22 Tests incorrects 17 Coût total $0.025 Temps de réponse (moy.) 4.62s
#184	Hunter Alpha medium	OpenRouter	1	4.7	$0.000	8/18	10.3s
Tests totaux 18 Tests incorrects 10 Coût total $0.000 Temps de réponse (moy.) 10.3s
#197	Grok 4.20 none	X AI	1	4.1	$0.057	6/18	1.11s
Tests totaux 18 Tests incorrects 12 Coût total $0.057 Temps de réponse (moy.) 1.11s
#199	Hy3 preview none	Tencent	1	4.0	$0.003	4/21	12.9s
Tests totaux 21 Tests incorrects 17 Coût total $0.003 Temps de réponse (moy.) 12.9s
#200	MiMo-V2-Flash none	Xiaomi	1	4.0	$0.025	4/21	2.76s
Tests totaux 21 Tests incorrects 17 Coût total $0.025 Temps de réponse (moy.) 2.76s
#201	Granite 4.1 8B none	IBM Granite	1	4.0	$0.007	2/22	1.45s
Tests totaux 22 Tests incorrects 20 Coût total $0.007 Temps de réponse (moy.) 1.45s
#204	Qwen3.5-9B medium	Qwen	1	3.8	$0.036	3/22	82.2s
Tests totaux 22 Tests incorrects 19 Coût total $0.036 Temps de réponse (moy.) 82.2s
#101	MiMo-V2.5 medium	Xiaomi	2	6.5	$0.082	12/22	32.2s
Tests totaux 22 Tests incorrects 10 Coût total $0.082 Temps de réponse (moy.) 32.2s
#137	North Mini Code medium	Cohere	2	5.9	$0.000	9/22	137.1s
Tests totaux 22 Tests incorrects 13 Coût total $0.000 Temps de réponse (moy.) 137.1s
#150	DeepSeek V4 Flash none	DeepSeek	2	5.6	$0.044	5/22	36.8s
Tests totaux 22 Tests incorrects 17 Coût total $0.044 Temps de réponse (moy.) 36.8s
#171	North Mini Code none	Cohere	2	5.1	$0.000	4/22	29.9s
Tests totaux 22 Tests incorrects 18 Coût total $0.000 Temps de réponse (moy.) 29.9s

Échecs Mise en forme supplémentaire

Filtrer les modèles

Meilleurs modèles par Nombre de Mise en forme supplémentaire

Nombre de Mise en forme supplémentaire vs Score

Meilleurs modèles par Temps de réponse (moy.)