AI BENCHY Compare

OpenAI: gpt-oss-120b vs Qwen: Qwen3.5-9B

Résumé

Comparaison benchmark gpt-oss-120b vs Qwen3.5-9B : gpt-oss-120b mène au score moyen avec 5.4 vs 4.6. Qwen3.5-9B a le coût de benchmark le plus bas avec $0.006 vs $0.010. Qwen3.5-9B est plus rapide avec 1.89s vs 21.61s, avec des taux de réussite de 38.6% vs 20.6%.

Modèle recommandé: Qwen3.5-9B - Il offre le meilleur compromis global: score compétitif (4.6), coût inférieur à gpt-oss-120b et temps de réponse équilibré.

Benchmarks générés à partir des suites de tests AI BENCHY le: 2026-06-10

Métrique	gpt-oss-120b gpt-oss-120b none Sortie: 2025-08-05 Disponible gratuitement	Qwen3.5-9B Qwen3.5-9B none Sortie: 2026-03-02

Métrique	gpt-oss-120b gpt-oss-120b none Sortie: 2025-08-05 Disponible gratuitement	Qwen3.5-9B Qwen3.5-9B none Sortie: 2026-03-02
Score	5.4	4.6
Rang	#127	#155
Fiabilité	10.0	10.0
Cohérence	9.1	9.7
Tests corrects
Taux de réussite par tentative	38.6%	20.6%
Tests instables	2	1
Exécutions totales	57	63
Coût par résultat	0.168	0.123
Coût total	$0.010	$0.006
Prix d'entrée	$0.039 / 1M	$0.100 / 1M
Prix de sortie	$0.180 / 1M	$0.150 / 1M
Total des jetons d'entrée	9,081	48,041
Jetons de sortie	51,664	3,952
Jetons de raisonnement	0	0
Temps de réponse (moy.)	21.61s	1.89s
Temps de réponse (max)	113.71s	6.03s
Temps de réponse (total)	345.79s	39.68s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#127 gpt-oss-120b

none

No showcase result has been generated for this model yet.

Cost: $0.000
Time: -
Tokens: 0 tok

#155 Qwen3.5-9B

none

Invalid SVG

Cost: $0.000
Time: 300.0s
Tokens: 0 tok

Meilleurs modèles par score

Score vs coût total

Temps de réponse (moy.)

Score vs Temps de réponse (moy.)

Total des jetons de sortie

Score vs Total des jetons de sortie

Répartition par catégorie

Astuces anti-IA	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
gpt-oss-120b	6.5	10.0	50.0%	0		32.84s	1,336	8,676	0
Qwen3.5-9B	3.1	9.9	0.0%	0		1.71s	696	582	0

Programmation	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
gpt-oss-120b	4.3	1.1	66.7%	1		9.57s	901	3,232	0
Qwen3.5-9B	3.9	7.8	11.1%	1		5.60s	7,913	1,042	0

Combiné	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
gpt-oss-120b	3.0	10.0	0.0%	0		0ms	0	0	0
Qwen3.5-9B	3.0	10.0	0.0%	0		5.91s	20,397	1,255	0

Analyse et extraction des données	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
gpt-oss-120b	6.5	10.0	50.0%	0		7.12s	2,421	598	0
Qwen3.5-9B	10.0	10.0	100.0%	0		847ms	7,788	249	0

Spécifique au domaine	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
gpt-oss-120b	3.0	10.0	0.0%	0		34.98s	1,294	29,483	0
Qwen3.5-9B	3.0	10.0	0.0%	0		464ms	789	24	0

Intelligence générale	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
gpt-oss-120b	4.8	10.0	0.0%	0		10.79s	584	615	0
Qwen3.5-9B	4.4	9.9	0.0%	0		552ms	522	99	0

Suivi des instructions	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
gpt-oss-120b	9.8	10.0	100.0%	0		5.06s	1,043	1,940	0
Qwen3.5-9B	6.5	10.0	50.0%	0		514ms	711	75	0

Résolution d'énigmes	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
gpt-oss-120b	6.0	7.2	55.6%	1		8.21s	1,188	3,982	0
Qwen3.5-9B	3.2	10.0	0.0%	0		621ms	714	347	0

Appel d'outils	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
gpt-oss-120b	3.0	10.0	0.0%	0		0ms	0	0	0
Qwen3.5-9B	10.0	10.0	100.0%	0		1.27s	8,301	273	0

Culture générale	Score	Cohérence	Taux de réussite par tentative	Tests instables	Tests corrects	Temps de réponse (moy.)	Jetons d'entrée	Jetons de sortie	Jetons de raisonnement
gpt-oss-120b	3.0	10.0	0.0%	0		47.29s	314	3,138	0
Qwen3.5-9B	3.0	10.0	0.0%	0		2.32s	210	6	0

Comparaison rapide

Changer la paire de comparaison