AI BENCHY Compare

Qwen: Qwen3.6 Max Preview vs xAI: Grok 4.20

Ringkasan

Perbandingan benchmark Qwen3.6 Max Preview vs Grok 4.20: Grok 4.20 unggul dalam skor rata-rata dengan 7.1 vs 6.9. Qwen3.6 Max Preview memiliki biaya benchmark lebih rendah di $0.075 vs $0.609. Qwen3.6 Max Preview lebih cepat di 3.30s vs 27.68s, dengan tingkat keberhasilan 58.7% vs 63.5%.

Model yang direkomendasikan: Qwen3.6 Max Preview - Its score stays close to the best score here (6.9 vs 7.1), while costing about 8.2x less than Grok 4.20.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-06-10

Metrik	Qwen3.6 Max Preview Qwen3.6 Max Preview none Rilis: 2026-04-20	Grok 4.20 Grok 4.20 medium Rilis: 2026-03-31

Metrik	Qwen3.6 Max Preview Qwen3.6 Max Preview none Rilis: 2026-04-20	Grok 4.20 Grok 4.20 medium Rilis: 2026-03-31
Skor	6.9	7.1
Peringkat	#75	#66
Keandalan	10.0	10.0
Konsistensi	9.2	8.8
Tes benar
Tingkat lulus per percobaan	58.7%	63.5%
Tes tidak stabil	2	3
Total Run	63	63
Biaya per hasil	0.824	8.309
Total Biaya	$0.075	$0.609
Harga input	$1.040 / 1M	$1.250 / 1M
Harga output	$6.240 / 1M	$2.500 / 1M
Total token input	42,509	44,433
Token output	4,779	1,819
Token penalaran	0	219,524
Waktu respons (rata-rata)	3.30s	27.68s
Waktu respons (maks)	20.51s	199.66s
Waktu respons (total)	69.40s	581.26s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#75 Qwen3.6 Max Preview

none

Cost: $0.025
Time: 83.9s
Tokens: 4,066 tok

#66 xAI: Grok 4.20

medium

Cost: $0.041
Time: 110.3s
Tokens: 16,336 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Trik anti-AI	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Qwen3.6 Max Preview	5.2	7.9	41.7%	1		2.63s	696	513	0
Grok 4.20	8.2	7.9	83.3%	1		3.95s	2,010	287	8,312

Pemrograman	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Qwen3.6 Max Preview	3.8	7.3	22.2%	1		3.12s	7,913	456	0
Grok 4.20	6.3	6.6	55.6%	1		109.93s	8,307	268	103,150

Gabungan	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Qwen3.6 Max Preview	3.0	10.0	0.0%	0		20.51s	14,949	2,842	0
Grok 4.20	10.0	10.0	100.0%	0		17.40s	12,909	232	9,556

Parsing dan ekstraksi data	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		2.87s	7,794	243	0
Grok 4.20	10.0	10.0	100.0%	0		4.17s	7,761	180	5,333

Spesifik domain	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Qwen3.6 Max Preview	7.7	10.0	66.7%	0		1.22s	789	18	0
Grok 4.20	5.3	10.0	33.3%	0		27.03s	1,764	375	49,339

Kecerdasan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Qwen3.6 Max Preview	4.3	10.0	0.0%	0		1.62s	522	76	0
Grok 4.20	3.9	2.6	33.3%	1		24.48s	825	65	6,440

Kepatuhan instruksi	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Qwen3.6 Max Preview	9.8	10.0	100.0%	0		1.40s	711	69	0
Grok 4.20	9.8	10.0	100.0%	0		4.26s	1,362	57	6,419

Pemecahan teka-teki	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		2.65s	714	321	0
Grok 4.20	7.7	10.0	66.7%	0		6.22s	1,689	149	7,913

Pemanggilan alat	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		5.27s	8,211	222	0
Grok 4.20	3.0	10.0	0.0%	0		13.68s	7,275	197	6,620

Pengetahuan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Qwen3.6 Max Preview	3.0	10.0	0.0%	0		1.97s	210	19	0
Grok 4.20	3.0	10.0	0.0%	0		63.48s	531	9	16,442

Perbandingan Cepat

Ganti Pasangan Perbandingan

Ring-2.6-1TmediumvsQwen3.6 Max Previewnone Seed-2.0-MinimediumvsQwen3.6 Max Previewnone Kimi K2.5mediumvsQwen3.6 Max Previewnone GPT-5.3 ChatnonevsGrok 4.20medium Gemini 3.1 Flash LitelowvsGrok 4.20medium Claude Opus 4.8nonevsGrok 4.20medium Gemini 3.1 Flash Lite PreviewnonevsGrok 4.20medium Step 3.7 FlashhighvsGrok 4.20medium DeepSeek V3.2mediumvsQwen3.6 Max Previewnone Step 3.7 FlashlowvsGrok 4.20medium Qwen3.6 Max PreviewnonevsStep 3.7 Flashhigh GPT-5.4 NanomediumvsQwen3.6 Max Previewnone