AI BENCHY Compare

DeepSeek: DeepSeek V3.2 vs Qwen: Qwen3.6 27B

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-05-22

Metrik	DeepSeek V3.2 DeepSeek V3.2 medium Rilis: 2025-12-01	Qwen3.6 27B Qwen3.6 27B medium Rilis: 2026-04-20

Metrik	DeepSeek V3.2 DeepSeek V3.2 medium Rilis: 2025-12-01	Qwen3.6 27B Qwen3.6 27B medium Rilis: 2026-04-20
Skor	7.0	6.6
Peringkat	#71	#83
Keandalan	9.1	9.9
Konsistensi	7.6	8.1
Tes benar
Tingkat lulus per percobaan	69.2%	58.3%
Tes tidak stabil	6	5
Total Run	60	60
Biaya per hasil	0.334	3.015
Total Biaya	$0.037	$0.272
Harga input	$0.252 / 1M	$0.317 / 1M
Harga output	$0.378 / 1M	$3.200 / 1M
Token output	7,049	13,007
Token penalaran	68,203	105,697
Waktu respons (rata-rata)	53.21s	57.65s
Waktu respons (maks)	189.03s	168.22s
Waktu respons (total)	1064.26s	1153.04s

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Trik anti-AI	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
DeepSeek V3.2	9.2	10.0	100.0%	0		24.23s	3,247	6,953
Qwen3.6 27B	8.3	10.0	75.0%	0		12.62s	582	4,311

Pemrograman	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
DeepSeek V3.2	3.9	5.8	33.3%	1		184.97s	640	21,230
Qwen3.6 27B	6.6	10.0	50.0%	0		165.39s	4,760	26,668

Gabungan	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
DeepSeek V3.2	10.0	10.0	100.0%	0		93.11s	571	6,296
Qwen3.6 27B	7.0	3.7	66.7%	1		83.07s	2,088	14,689

Parsing dan ekstraksi data	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
DeepSeek V3.2	10.0	10.0	100.0%	0		36.09s	207	7,693
Qwen3.6 27B	3.5	1.4	50.0%	2		37.30s	568	9,404

Spesifik domain	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
DeepSeek V3.2	2.9	4.4	22.2%	2		24.27s	21	6,838
Qwen3.6 27B	2.9	7.2	11.1%	1		73.38s	3,510	20,352

Kecerdasan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
DeepSeek V3.2	3.8	2.5	50.0%	1		58.29s	49	2,189
Qwen3.6 27B	6.5	3.4	66.7%	1		39.53s	81	3,045

Kepatuhan instruksi	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
DeepSeek V3.2	10.0	10.0	100.0%	0		35.78s	1,397	2,845
Qwen3.6 27B	10.0	10.0	100.0%	0		37.96s	346	6,548

Pemecahan teka-teki	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
DeepSeek V3.2	6.7	5.0	66.7%	2		36.87s	390	6,281
Qwen3.6 27B	7.7	10.0	66.7%	0		60.21s	281	11,919

Pemanggilan alat	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
DeepSeek V3.2	10.0	10.0	100.0%	0		34.81s	507	859
Qwen3.6 27B	10.0	10.0	100.0%	0		16.88s	390	2,954

Pengetahuan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
DeepSeek V3.2	3.0	10.0	0.0%	0		83.99s	20	7,019
Qwen3.6 27B	3.0	10.0	0.0%	0		80.99s	401	5,807

Perbandingan Cepat

Ganti Pasangan Perbandingan

Qwen3.6 27BmediumvsGrok Build 0.1none Gemini 3.1 Flash LitenonevsQwen3.6 27Bmedium GPT-5.5nonevsQwen3.6 27Bmedium Claude Sonnet 4.6nonevsDeepSeek V3.2medium DeepSeek V4 ProhighvsQwen3.6 27Bmedium Gemini 3.1 Flash LiteminimalvsQwen3.6 27Bmedium DeepSeek V3.2mediumvsQwen3.6 Max Previewnone Gemma 4 31BnoneTersedia gratisvsQwen3.6 27Bmedium DeepSeek V3.2mediumvsRing-2.6-1Tnone DeepSeek V3.2mediumvsGemma 4 31BnoneTersedia gratis Qwen3.6 27BmediumvsGLM 5none DeepSeek V3.2mediumvsGemini 3.1 Flash Liteminimal