AI BENCHY Compare

OpenAI: gpt-oss-120b vs Qwen: Qwen3.5-9B

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-03-12

Metrică	gpt-oss-120b gpt-oss-120b medium Lansare: 2025-08-05 Disponibil gratuit	Qwen3.5-9B Qwen3.5-9B none Lansare: 2026-03-02

Metrică	gpt-oss-120b gpt-oss-120b medium Lansare: 2025-08-05 Disponibil gratuit	Qwen3.5-9B Qwen3.5-9B none Lansare: 2026-03-02
Rang	#43	#60
Scor mediu	5.1	3.4
Consistență	7.4	10.0
Cost per rezultat	0.135	0.111
Cost total	$0.010	$0.005
Teste corecte
Rată de trecere pe încercare	54.2%	25.0%
Teste instabile	5	0
Rulări totale	48	48
Tokenuri de ieșire	13,210	2,939
Tokenuri de raționament	34,230	0
Timp de răspuns (mediu)	16.65s	1.06s
Timp de răspuns (maxim)	50.92s	5.91s
Timp de răspuns (total)	149.88s	16.95s

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor mediu vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor mediu vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	7.0	9.8	66.7%	0		19.76s	3,463	2,077
Qwen3.5-9B	10.0	9.9	0.0%	0		1.02s	576	0

Combinat	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	10.0	10.0	100.0%	0		31.18s	694	5,072
Qwen3.5-9B	10.0	10.0	0.0%	0		5.91s	1,255	0

Parsare și extragere de date	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	5.5	5.9	66.7%	1		1.98s	241	1,114
Qwen3.5-9B	9.9	10.0	100.0%	0		847ms	249	0

Specific domeniului	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	10.0	4.4	22.2%	2		50.92s	6,784	20,606
Qwen3.5-9B	10.0	10.0	0.0%	0		464ms	24	0

Inteligență generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	3.0	10.0	0.0%	0		7.90s	107	387
Qwen3.5-9B	3.0	9.9	0.0%	0		552ms	99	0

Respectarea instrucțiunilor	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	9.5	10.0	100.0%	0		7.63s	126	1,799
Qwen3.5-9B	5.5	10.0	50.0%	0		514ms	75	0

Puzzle Solving	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	1.7	4.7	22.2%	2		11.80s	1,508	2,092
Qwen3.5-9B	10.0	9.9	0.0%	0		683ms	388	0

Apelare instrumente	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	9.0	10.0	100.0%	0		6.91s	287	1,083
Qwen3.5-9B	10.0	10.0	100.0%	0		1.27s	273	0

Comparație rapidă

Schimbă perechea de comparație

gpt-oss-120bmediumDisponibil gratuitvsQwen3.5-122B-A10Bnone Gemini 2.5 Flashnonevsgpt-oss-120bmediumDisponibil gratuit gpt-oss-120bmediumDisponibil gratuitvsQwen3.5-Flashnone Seed-2.0-Litenonevsgpt-oss-120bmediumDisponibil gratuit gpt-oss-120bmediumDisponibil gratuitvsQwen3.5-27Bnone Qwen3.5-9BnonevsGLM 4.7 Flashmedium gpt-oss-120bmediumDisponibil gratuitvsQwen3.5-35B-A3Bnone DeepSeek V3.2nonevsgpt-oss-120bmediumDisponibil gratuit gpt-oss-120bmediumDisponibil gratuitvsHunter Alphanone gpt-oss-120bmediumDisponibil gratuitvsGrok 4.20 Betanone Trinity Large PreviewnoneDisponibil gratuitvsgpt-oss-120bmediumDisponibil gratuit gpt-oss-120bmediumDisponibil gratuitvsGLM 5none