AI BENCHY Compare

Mistral: Mistral Small 4 vs Qwen: Qwen3.5-27B

Résumé

Comparaison benchmark Mistral Small 4 vs Qwen3.5-27B : Qwen3.5-27B mène au score moyen avec 5.9 vs 5.1. Mistral Small 4 a le coût de benchmark le plus bas avec $0.007 vs $0.015. Mistral Small 4 est plus rapide avec 630ms vs 1.68s, avec des taux de réussite de 27.0% vs 38.1%.

Modèle recommandé: Mistral Small 4 - Son score reste proche du meilleur score ici (5.1 vs 5.9) tout en coûtant environ 2.1x moins que Qwen3.5-27B.

Benchmarks générés à partir des suites de tests AI BENCHY le: 2026-06-12

Métrique	Mistral Small 4 Mistral Small 4 none Sortie: 2026-03-16	Qwen3.5-27B Qwen3.5-27B none Sortie: 2026-02-24

Métrique	Mistral Small 4 Mistral Small 4 none Sortie: 2026-03-16	Qwen3.5-27B Qwen3.5-27B none Sortie: 2026-02-24
Score	5.1	5.9
Rang	#136	#109
Fiabilité	10.0	10.0
Cohérence	9.5	9.3
Tests corrects
Taux de réussite par tentative	27.0%	38.1%
Tests instables	1	2
Exécutions totales	63	63
Coût par résultat	0.139	0.249
Coût total	$0.007	$0.015
Prix d'entrée	$0.150 / 1M	$0.195 / 1M
Prix de sortie	$0.600 / 1M	$1.560 / 1M
Total des jetons d'entrée	37,309	44,478
Jetons de sortie	2,201	3,592
Jetons de raisonnement	0	0
Temps de réponse (moy.)	630ms	1.68s
Temps de réponse (max)	1.72s	9.39s
Temps de réponse (total)	13.22s	35.25s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#136 Mistral Small 4

none

Cost: $0.002
Time: 10.4s
Tokens: 2,370 tok

#109 Qwen3.5-27B

none

Cost: $0.007
Time: 42.9s
Tokens: 4,273 tok

Meilleurs modèles par score

Score vs coût total

Temps de réponse (moy.)

Score vs Temps de réponse (moy.)

Total des jetons de sortie

Score vs Total des jetons de sortie

Répartition par catégorie

Astuces anti-IA	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Mistral Small 4	3.4	7.9	16.7%	1		395ms	708	182	0
Qwen3.5-27B	4.8	10.0	25.0%	0		788ms	696	267	0

Programmation	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Mistral Small 4	3.7	9.7	0.0%	0		901ms	7,636	619	0
Qwen3.5-27B	5.8	10.0	33.3%	0		1.80s	7,913	415	0

Combiné	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Mistral Small 4	3.0	10.0	0.0%	0		1.72s	11,640	496	0
Qwen3.5-27B	2.8	1.6	33.3%	1		9.39s	16,918	1,461	0

Analyse et extraction des données	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Mistral Small 4	10.0	10.0	100.0%	0		822ms	7,914	261	0
Qwen3.5-27B	10.0	10.0	100.0%	0		1.43s	7,794	243	0

Spécifique au domaine	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Mistral Small 4	5.3	10.0	33.3%	0		367ms	798	28	0
Qwen3.5-27B	3.0	10.0	0.0%	0		540ms	789	15	0

Intelligence générale	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Mistral Small 4	4.0	10.0	0.0%	0		729ms	519	205	0
Qwen3.5-27B	5.0	10.0	0.0%	0		2.51s	522	126	0

Suivi des instructions	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Mistral Small 4	6.5	10.0	50.0%	0		380ms	729	69	0
Qwen3.5-27B	6.3	10.0	50.0%	0		1.03s	711	69	0

Résolution d'énigmes	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Mistral Small 4	3.1	9.9	0.0%	0		399ms	735	111	0
Qwen3.5-27B	6.7	7.9	55.6%	1		1.38s	714	683	0

Appel d'outils	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Mistral Small 4	10.0	10.0	100.0%	0		1.40s	6,420	213	0
Qwen3.5-27B	10.0	10.0	100.0%	0		3.54s	8,211	303	0

Culture générale	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
Mistral Small 4	3.0	10.0	0.0%	0		397ms	210	17	0
Qwen3.5-27B	3.0	10.0	0.0%	0		599ms	210	10	0

Comparaison rapide

Changer la paire de comparaison

MiniMax M2.7mediumvsMistral Small 4none CobuddymediumvsMistral Small 4none Gemini 3.1 Flash LiteminimalvsQwen3.5-27Bnone DeepSeek V4 ProhighvsQwen3.5-27Bnone Gemma 4 31BmediumDisponible gratuitementvsQwen3.5-27Bnone MiniMax M2.5mediumvsMistral Small 4none Nemotron 3 SupermediumDisponible gratuitementvsQwen3.5-27Bnone Mistral Small 4nonevsQwen3 Coder Nextmedium Gemini 3.1 Flash LitelowvsQwen3.5-27Bnone Gemini 3.1 Flash Lite PreviewlowvsQwen3.5-27Bnone MiniMax M2.7mediumvsQwen3.5-27Bnone GPT-5 NanomediumvsQwen3.5-27Bnone