AI BENCHY Compare

Modele comparate

Rezumat

Comparație benchmark Qwen3.6 35B A3B vs Qwen3.5-27B vs DeepSeek V4 FlashDeepSeek V4 Flash conduce la Scor cu 8.3. Qwen3.6 35B A3B conduce la Fiabilitate cu 10.0. DeepSeek V4 Flash are cel mai mic Cost total, $0.027. Qwen3.6 35B A3B are cel mai rapid timp de răspuns, 18.08s.

Model recomandat: DeepSeek V4 Flash - Are cel mai bun scor aici (8.3) și costă de aproximativ 13.0x mai puțin decât celelalte modele din această comparație.

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-06-18

Metrică	Qwen3.6 35B A3B Qwen3.6 35B A3B medium Lansare: 2026-04-20	Qwen3.5-27B Qwen3.5-27B medium Lansare: 2026-02-24	DeepSeek V4 Flash DeepSeek V4 Flash high Lansare: 2026-04-24

Metrică	Qwen3.6 35B A3B Qwen3.6 35B A3B medium Lansare: 2026-04-20	Qwen3.5-27B Qwen3.5-27B medium Lansare: 2026-02-24	DeepSeek V4 Flash DeepSeek V4 Flash high Lansare: 2026-04-24
Scor	6.7	7.9	8.3
Rang	#75	#29	#23
Fiabilitate	10.0	10.0	10.0
Consistență	9.6	8.5	8.5
Teste corecte
Rată de trecere pe încercare	63.5%	73.0%	74.6%
Teste instabile	1	4	4
Rulări totale	63	63	63
Cost per rezultat	1.094	4.901	0.299
Cost total	$0.146	$0.536	$0.027
Preț de intrare	$0.140 / 1M	$0.195 / 1M	$0.090 / 1M
Preț de ieșire	$1.000 / 1M	$1.560 / 1M	$0.180 / 1M
Total tokenuri de intrare	16,385	42,164	39,745
Tokenuri de ieșire	19,632	8,534	10,310
Tokenuri de raționament	130,219	329,289	123,501
Timp de răspuns (mediu)	18.08s	68.39s	45.85s
Timp de răspuns (maxim)	86.11s	234.36s	218.13s
Timp de răspuns (total)	343.61s	1436.24s	962.79s

Prezentare generare

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#75 Qwen3.6 35B A3B

medium

SVG invalid

Cost: $0.000
Timp: 300.0s
Tokenuri: 0 tok

#29 Qwen3.5-27B

medium

Cost: $0.008
Timp: 62.0s
Tokenuri: 3,099 tok

#23 DeepSeek V4 Flash

high

Cost: $0.003
Timp: 93.1s
Tokenuri: 7,926 tok

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.6 35B A3B	10.0	10.0	100.0%	0	6.02s	672	1,154	12,385
Qwen3.5-27B	8.7	7.9	91.7%	1	19.75s	672	569	31,505
DeepSeek V4 Flash	8.3	10.0	75.0%	0	28.51s	540	140	7,770

Programare	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.6 35B A3B	7.7	10.0	66.7%	0	50.55s	5,051	7,929	37,223
Qwen3.5-27B	6.2	7.1	55.6%	1	160.69s	7,895	6,381	89,388
DeepSeek V4 Flash	7.8	10.0	66.7%	0	50.60s	7,279	395	34,862

Combinat	Scor	Consistență	Rată de trecere pe încercare	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.6 35B A3B	3.0	10.0	0.0%	0ms	0	0	0
Qwen3.5-27B	10.0	10.0	100.0%	163.96s	14,946	483	9,991
DeepSeek V4 Flash	10.0	10.0	100.0%	76.57s	14,016	465	7,347

Parsare și extragere de date	Scor	Consistență	Rată de trecere pe încercare	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.6 35B A3B	10.0	10.0	100.0%	12.99s	7,776	2,591	9,968
Qwen3.5-27B	10.0	10.0	100.0%	30.26s	7,782	270	16,150
DeepSeek V4 Flash	10.0	10.0	100.0%	28.03s	7,290	201	1,179

Specific domeniului	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.6 35B A3B	5.3	7.2	44.4%	1	22.50s	771	6,193	39,116
Qwen3.5-27B	5.3	10.0	33.3%	0	79.53s	553	43	52,368
DeepSeek V4 Flash	4.1	4.4	44.5%	2	100.31s	666	27	59,249

Inteligență generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.6 35B A3B	4.4	9.9	0.0%	0	8.66s	516	129	4,569
Qwen3.5-27B	6.1	3.1	66.7%	1	101.41s	524	70	23,147
DeepSeek V4 Flash	6.1	3.1	66.7%	1	25.15s	471	79	632

Respectarea instrucțiunilor	Scor	Consistență	Rată de trecere pe încercare	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.6 35B A3B	10.0	10.0	100.0%	7.50s	699	219	7,404
Qwen3.5-27B	10.0	10.0	100.0%	19.66s	699	97	11,638
DeepSeek V4 Flash	10.0	10.0	100.0%	15.36s	627	63	1,622

Rezolvare de puzzle-uri	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.6 35B A3B	8.0	10.0	66.7%	0	5.95s	696	655	9,228
Qwen3.5-27B	8.2	7.7	77.8%	1	59.60s	696	242	70,096
DeepSeek V4 Flash	8.2	7.2	88.9%	1	26.11s	594	196	1,767

Apelare instrumente	Scor	Consistență	Rată de trecere pe încercare	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.6 35B A3B	3.0	10.0	0.0%	0ms	0	0	0
Qwen3.5-27B	10.0	10.0	100.0%	7.45s	8,193	348	1,323
DeepSeek V4 Flash	10.0	10.0	100.0%	74.73s	8,079	228	542

Cultură generală	Scor	Consistență	Rată de trecere pe încercare	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.6 35B A3B	3.0	10.0	0.0%	32.90s	204	762	10,326
Qwen3.5-27B	3.0	10.0	0.0%	85.11s	204	31	23,683
DeepSeek V4 Flash	3.0	10.0	0.0%	54.46s	183	8,516	8,531

Comparație rapidă

Schimbă perechea de comparație