AI BENCHY Compare

OpenAI: GPT-5.4 Nano vs Qwen: Qwen3.5-9B

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-05-01

Metrică	GPT-5.4 Nano GPT-5.4 Nano none Lansare: 2026-03-17	Qwen3.5-9B Qwen3.5-9B none Lansare: 2026-03-02

Metrică	GPT-5.4 Nano GPT-5.4 Nano none Lansare: 2026-03-17	Qwen3.5-9B Qwen3.5-9B none Lansare: 2026-03-02
Scor	4.6	4.8
Rang	#127	#124
Fiabilitate	N/D	N/D
Consistență	7.4	9.6
Teste corecte
Rată de trecere pe încercare	33.3%	24.1%
Teste instabile	6	1
Rulări totale	54	54
Cost per rezultat	0.299	0.116
Cost total	$0.009	$0.005
Preț de intrare	$0.200 / 1M	$0.100 / 1M
Preț de ieșire	$1.250 / 1M	$0.150 / 1M
Tokenuri de ieșire	2,762	3,951
Tokenuri de raționament	0	0
Timp de răspuns (mediu)	1.40s	1.47s
Timp de răspuns (maxim)	3.84s	5.91s
Timp de răspuns (total)	25.14s	26.43s

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
GPT-5.4 Nano	3.5	8.0	16.7%	1		1.18s	800	0
Qwen3.5-9B	3.1	9.9	0.0%	0		1.71s	582	0

Programare	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
GPT-5.4 Nano	7.1	3.7	66.7%	1		1.43s	577	0
Qwen3.5-9B	5.2	3.4	33.3%	1		5.69s	1,006	0

Combinat	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
GPT-5.4 Nano	3.0	10.0	0.0%	0		3.84s	280	0
Qwen3.5-9B	3.0	10.0	0.0%	0		5.91s	1,255	0

Parsare și extragere de date	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
GPT-5.4 Nano	6.5	10.0	50.0%	0		1.11s	219	0
Qwen3.5-9B	10.0	10.0	100.0%	0		847ms	249	0

Specific domeniului	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
GPT-5.4 Nano	2.9	4.4	22.2%	2		926ms	52	0
Qwen3.5-9B	3.0	10.0	0.0%	0		464ms	24	0

Inteligență generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
GPT-5.4 Nano	3.8	2.5	33.3%	1		1.31s	180	0
Qwen3.5-9B	4.4	9.9	0.0%	0		552ms	99	0

Respectarea instrucțiunilor	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
GPT-5.4 Nano	6.3	10.0	50.0%	0		787ms	84	0
Qwen3.5-9B	6.5	10.0	50.0%	0		514ms	75	0

Rezolvare de puzzle-uri	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
GPT-5.4 Nano	3.7	7.3	22.2%	1		1.29s	348	0
Qwen3.5-9B	3.2	9.9	0.0%	0		683ms	388	0

Apelare instrumente	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
GPT-5.4 Nano	10.0	10.0	100.0%	0		3.40s	222	0
Qwen3.5-9B	10.0	10.0	100.0%	0		1.27s	273	0

Comparație rapidă

Schimbă perechea de comparație

GPT-5.4 NanononevsGLM 4.7 Flashmedium Qwen3.5-9BnonevsGLM 4.7 Flashmedium GPT-5.4 NanononevsQwen3.5-9Bmedium GPT-5.4 NanononevsQwen3 Coder Nextmedium Nemotron 3 Nano Omni 30b A3b ReasoningmediumDisponibil gratuitvsQwen3.5-9Bnone Elephant AlphamediumvsQwen3.5-9Bnone MiniMax M2.7mediumvsQwen3.5-9Bnone Nemotron 3 Nano Omni 30b A3b ReasoningmediumDisponibil gratuitvsGPT-5.4 Nanonone GPT-5.4 NanononevsElephant Alphamedium MiniMax M2.7mediumvsGPT-5.4 Nanonone MiniMax M2.5mediumDisponibil gratuitvsQwen3.5-9Bnone Mistral Small 4mediumvsQwen3.5-9Bnone