AI BENCHY Compare

DeepSeek: DeepSeek V4 Pro vs xAI: Grok Build 0.1

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-05-22

Metrik	DeepSeek V4 Pro DeepSeek V4 Pro high Rilis: 2026-04-24	Grok Build 0.1 Grok Build 0.1 none Rilis: 2026-05-21

Metrik	DeepSeek V4 Pro DeepSeek V4 Pro high Rilis: 2026-04-24	Grok Build 0.1 Grok Build 0.1 none Rilis: 2026-05-21
Skor	6.6	6.6
Peringkat	#80	#82
Keandalan	9.0	10.0
Konsistensi	8.3	8.0
Tes benar
Tingkat lulus per percobaan	66.7%	60.4%
Tes tidak stabil	4	4
Total Run	60	57
Biaya per hasil	1.927	7.805
Total Biaya	$0.212	$0.547
Harga input	$0.435 / 1M	$1.000 / 1M
Harga output	$0.870 / 1M	$2.000 / 1M
Token output	12,211	267,275
Token penalaran	53,774	0
Waktu respons (rata-rata)	58.93s	28.69s
Waktu respons (maks)	358.35s	138.35s
Waktu respons (total)	1119.75s	459.00s

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Trik anti-AI	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
DeepSeek V4 Pro	7.4	10.0	75.0%	0		16.53s	71	3,617
Grok Build 0.1	8.7	7.9	91.7%	1		6.30s	11,162	0

Pemrograman	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
DeepSeek V4 Pro	2.8	5.0	25.0%	1		51.77s	105	2,641
Grok Build 0.1	10.0	10.0	100.0%	0		21.41s	16,568	0

Gabungan	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
DeepSeek V4 Pro	10.0	10.0	100.0%	0		65.02s	465	5,914
Grok Build 0.1	0.0	0.0	0.0%	0		0ms	0	0

Parsing dan ekstraksi data	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
DeepSeek V4 Pro	8.8	10.0	100.0%	0		23.62s	229	1,710
Grok Build 0.1	4.7	1.6	66.7%	1		9.33s	6,359	0

Spesifik domain	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
DeepSeek V4 Pro	3.0	6.9	16.7%	1		205.66s	10,529	28,089
Grok Build 0.1	3.6	7.2	22.2%	1		103.71s	179,469	0

Kecerdasan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
DeepSeek V4 Pro	6.1	3.1	66.7%	1		25.09s	76	1,152
Grok Build 0.1	4.3	10.0	0.0%	0		12.47s	6,647	0

Kepatuhan instruksi	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
DeepSeek V4 Pro	10.0	10.0	100.0%	0		41.16s	205	2,416
Grok Build 0.1	9.8	10.0	100.0%	0		7.36s	8,970	0

Pemecahan teka-teki	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
DeepSeek V4 Pro	7.4	7.2	88.9%	1		34.92s	106	3,835
Grok Build 0.1	6.4	7.7	55.6%	1		9.55s	14,982	0

Pemanggilan alat	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
DeepSeek V4 Pro	10.0	10.0	100.0%	0		21.33s	372	593
Grok Build 0.1	0.0	0.0	0.0%	0		0ms	0	0

Pengetahuan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
DeepSeek V4 Pro	3.0	10.0	0.0%	0		39.14s	53	3,807
Grok Build 0.1	3.0	10.0	0.0%	0		36.09s	23,118	0

Perbandingan Cepat

Ganti Pasangan Perbandingan

DeepSeek V4 ProhighvsKimi K2.5medium DeepSeek V4 ProhighvsGemini 3.1 Flash Liteminimal Qwen3.6 27BmediumvsGrok Build 0.1none DeepSeek V4 ProhighvsGrok 4.20medium Kimi K2.5mediumvsGrok Build 0.1none Gemini 3.1 Flash LiteminimalvsGrok Build 0.1none DeepSeek V4 ProhighvsGemma 4 31BnoneTersedia gratis DeepSeek V4 ProhighvsQwen3.6 27Bmedium DeepSeek V4 ProhighvsGemini 3.1 Flash Litenone DeepSeek V4 ProhighvsGPT-5.5none DeepSeek V4 ProhighvsQwen3.5 Plus 2026-02-15none DeepSeek V4 ProhighvsGPT-5 Minimedium