AI BENCHY Compare

Qwen: Qwen3.7 Max vs StepFun: Step 3.7 Flash

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-05-29

Metrică	Qwen3.7 Max Qwen3.7 Max none Lansare: 2026-05-22	Step 3.7 Flash Step 3.7 Flash medium Lansare: 2026-05-29

Metrică	Qwen3.7 Max Qwen3.7 Max none Lansare: 2026-05-22	Step 3.7 Flash Step 3.7 Flash medium Lansare: 2026-05-29
Scor	7.9	7.9
Rang	#29	#32
Fiabilitate	10.0	9.9
Consistență	10.0	9.2
Teste corecte
Rată de trecere pe încercare	70.0%	71.7%
Teste instabile	0	2
Rulări totale	60	58
Cost per rezultat	0.719	2.663
Cost total	$0.101	$0.347
Preț de intrare	$1.250 / 1M	$0.200 / 1M
Preț de ieșire	$3.750 / 1M	$1.150 / 1M
Tokenuri de ieșire	1,988	294,481
Tokenuri de raționament	0	0
Timp de răspuns (mediu)	1.30s	18.32s
Timp de răspuns (maxim)	3.92s	113.98s
Timp de răspuns (total)	25.95s	366.45s

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.7 Max	6.5	10.0	50.0%	0		1.08s	242	0
Step 3.7 Flash	8.7	7.9	91.7%	1		9.65s	32,185	0

Programare	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.7 Max	6.8	10.0	50.0%	0		1.39s	576	0
Step 3.7 Flash	8.2	6.7	83.3%	1		10.64s	19,320	0

Combinat	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.7 Max	3.0	10.0	0.0%	0		2.17s	171	0
Step 3.7 Flash	10.0	10.0	100.0%	0		9.06s	7,106	0

Parsare și extragere de date	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.7 Max	10.0	10.0	100.0%	0		1.35s	243	0
Step 3.7 Flash	10.0	10.0	100.0%	0		2.75s	3,020	0

Specific domeniului	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.7 Max	7.7	10.0	66.7%	0		975ms	15	0
Step 3.7 Flash	7.7	10.0	66.7%	0		48.27s	70,347	0

Inteligență generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.7 Max	10.0	10.0	100.0%	0		1.04s	120	0
Step 3.7 Flash	4.0	10.0	0.0%	0		6.85s	3,987	0

Respectarea instrucțiunilor	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.7 Max	10.0	10.0	100.0%	0		943ms	72	0
Step 3.7 Flash	9.8	10.0	100.0%	0		1.83s	2,166	0

Rezolvare de puzzle-uri	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.7 Max	10.0	10.0	100.0%	0		1.13s	314	0
Step 3.7 Flash	5.7	9.9	33.3%	0		6.19s	15,071	0

Apelare instrumente	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.7 Max	10.0	10.0	100.0%	0		3.92s	222	0
Step 3.7 Flash	10.0	10.0	100.0%	0		4.16s	2,115	0

Cultură generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.7 Max	3.0	10.0	0.0%	0		856ms	13	0
Step 3.7 Flash	3.0	10.0	0.0%	0		113.98s	139,164	0

Comparație rapidă

Schimbă perechea de comparație

GPT-5.4mediumvsQwen3.7 Maxnone Qwen3.7 MaxnonevsGLM 5 Turbomedium GPT-5.2 ChatnonevsStep 3.7 Flashmedium Gemini 3.5 FlashminimalvsQwen3.7 Maxnone Gemini 3.5 FlashminimalvsStep 3.7 Flashmedium Gemma 4 26B A4BmediumDisponibil gratuitvsQwen3.7 Maxnone Gemma 4 31BmediumDisponibil gratuitvsQwen3.7 Maxnone Qwen3.7 MaxnonevsGrok 4.3medium Seed-2.0-LitemediumvsQwen3.7 Maxnone Gemini 3.1 Flash Lite PreviewmediumvsQwen3.7 Maxnone Gemini 3.1 Flash LitemediumvsQwen3.7 Maxnone Gemini 2.5 FlashmediumvsQwen3.7 Maxnone