AI BENCHY Compare

OpenAI: GPT-5.4 Mini vs Qwen: Qwen3.7 Plus

Résumé

Comparaison benchmark GPT-5.4 Mini vs Qwen3.7 Plus : GPT-5.4 Mini mène au score moyen avec 8.0 vs 7.2. Qwen3.7 Plus a le coût de benchmark le plus bas avec $0.023 vs $0.526. Qwen3.7 Plus est plus rapide avec 2.85s vs 22.34s, avec des taux de réussite de 73.0% vs 47.6%.

Modèle recommandé: Qwen3.7 Plus - Il offre le meilleur compromis global: score compétitif (7.2), coût inférieur à GPT-5.4 Mini et temps de réponse équilibré.

Benchmarks générés à partir des suites de tests AI BENCHY le: 2026-06-12

Métrique	GPT-5.4 Mini GPT-5.4 Mini medium Sortie: 2026-03-17	Qwen3.7 Plus Qwen3.7 Plus none Sortie: 2026-06-03

Métrique	GPT-5.4 Mini GPT-5.4 Mini medium Sortie: 2026-03-17	Qwen3.7 Plus Qwen3.7 Plus none Sortie: 2026-06-03
Score	8.0	7.2
Rang	#30	#61
Fiabilité	10.0	10.0
Cohérence	8.0	10.0
Tests corrects
Taux de réussite par tentative	73.0%	47.6%
Tests instables	5	0
Exécutions totales	63	63
Coût par résultat	4.381	0.276
Coût total	$0.526	$0.023
Prix d'entrée	$0.750 / 1M	$0.320 / 1M
Prix de sortie	$4.500 / 1M	$1.280 / 1M
Total des jetons d'entrée	34,116	42,510
Jetons de sortie	2,181	6,578
Jetons de raisonnement	108,937	0
Temps de réponse (moy.)	22.34s	2.85s
Temps de réponse (max)	138.75s	29.38s
Temps de réponse (total)	469.20s	59.86s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#30 GPT-5.4 Mini

medium

Cost: $0.056
Time: 95.5s
Tokens: 12,464 tok

#61 Qwen3.7 Plus

none

Cost: $0.019
Time: 213.5s
Tokens: 11,960 tok

Meilleurs modèles par score

Score vs coût total

Temps de réponse (moy.)

Score vs Temps de réponse (moy.)

Total des jetons de sortie

Score vs Total des jetons de sortie

Répartition par catégorie

Astuces anti-IA	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
GPT-5.4 Mini	8.6	7.9	91.7%	1		4.05s	606	296	2,876
Qwen3.7 Plus	6.5	10.0	50.0%	0		1.38s	696	349	0

Programmation	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
GPT-5.4 Mini	8.4	7.4	88.9%	1		57.87s	7,305	467	40,902
Qwen3.7 Plus	5.5	10.0	33.3%	0		2.15s	7,911	639	0

Combiné	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
GPT-5.4 Mini	10.0	10.0	100.0%	0		17.81s	11,019	317	4,317
Qwen3.7 Plus	10.0	10.0	100.0%	0		29.38s	14,952	4,505	0

Analyse et extraction des données	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
GPT-5.4 Mini	10.0	10.0	100.0%	0		2.43s	7,140	234	650
Qwen3.7 Plus	10.0	10.0	100.0%	0		1.43s	7,794	243	0

Spécifique au domaine	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
GPT-5.4 Mini	4.1	4.4	44.5%	2		65.31s	619	60	43,286
Qwen3.7 Plus	3.0	10.0	0.0%	0		868ms	789	18	0

Intelligence générale	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
GPT-5.4 Mini	4.5	10.0	0.0%	0		3.72s	477	150	510
Qwen3.7 Plus	5.3	10.0	0.0%	0		1.33s	522	78	0

Suivi des instructions	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
GPT-5.4 Mini	9.8	10.0	100.0%	0		2.13s	660	96	1,185
Qwen3.7 Plus	6.3	10.0	50.0%	0		929ms	711	72	0

Résolution d'énigmes	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
GPT-5.4 Mini	7.8	10.0	66.7%	0		4.37s	642	278	2,443
Qwen3.7 Plus	7.7	10.0	66.7%	0		1.71s	714	443	0

Appel d'outils	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
GPT-5.4 Mini	4.7	1.6	66.7%	1		9.62s	5,453	251	2,594
Qwen3.7 Plus	10.0	10.0	100.0%	0		3.54s	8,211	222	0

Culture générale	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
GPT-5.4 Mini	3.0	10.0	0.0%	0		30.10s	195	32	10,174
Qwen3.7 Plus	3.0	10.0	0.0%	0		1.21s	210	9	0

Comparaison rapide

Changer la paire de comparaison

Gemma 4 26B A4BmediumDisponible gratuitementvsQwen3.7 Plusnone Qwen3.7 PlusnonevsMiMo-V2-Flashmedium Qwen3.7 PlusnonevsStep 3.7 Flashhigh Qwen3.7 PlusnonevsGLM 5.1medium Qwen3.7 PlusnonevsGLM 5V Turbomedium Kimi K2.7 CodemediumvsQwen3.7 Plusnone Qwen3.7 PlusnonevsGrok 4.20medium Gemini 3 Flash PreviewlowvsQwen3.7 Plusnone Qwen3.7 PlusnonevsStep 3.5 Flashmedium Qwen3.7 PlusnonevsMiMo-V2.5-Promedium Seed-2.0-MinimediumvsQwen3.7 Plusnone DeepSeek V4 FlashhighvsGPT-5.4 Minimedium