AI BENCHY Compare

StepFun: Step 3.7 Flash vs xAI: Grok Build 0.1

Ringkasan

Perbandingan benchmark Step 3.7 Flash vs Grok Build 0.1: Grok Build 0.1 unggul dalam skor rata-rata dengan 7.6 vs 7.1. Grok Build 0.1 memiliki biaya benchmark lebih rendah di $0.927 vs $1.148. Grok Build 0.1 lebih cepat di 49.90s vs 64.46s, dengan tingkat keberhasilan 63.5% vs 61.9%.

Model yang direkomendasikan: Grok Build 0.1 - It has the strongest score in this comparison (7.6) and the best overall balance of cost and response time across all 2 models.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-07-02

Metrik	Step 3.7 Flash Step 3.7 Flash high Rilis: 2026-05-29	Grok Build 0.1 Grok Build 0.1 medium Rilis: 2026-05-21

Metrik	Step 3.7 Flash Step 3.7 Flash high Rilis: 2026-05-29	Grok Build 0.1 Grok Build 0.1 medium Rilis: 2026-05-21
Skor	7.1	7.6
Peringkat	#65	#44
Keandalan	10.0	10.0
Konsistensi	8.2	9.9
Tes benar
Tingkat lulus per percobaan	63.5%	61.9%
Tes tidak stabil	4	0
Total Run	63	63
Biaya per hasil	10.434	7.124
Total Biaya	$1.148	$0.927
Harga input	$0.200 / 1M	$1.000 / 1M
Harga output	$1.150 / 1M	$2.000 / 1M
Total token input	38,391	44,418
Token output	991,355	2,782
Token penalaran	0	438,018
Waktu respons (rata-rata)	64.46s	49.90s
Waktu respons (maks)	364.99s	252.69s
Waktu respons (total)	1353.57s	1047.92s

Showcase generasi

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#65 Step 3.7 Flash

high

Biaya: $0.007
Waktu: 63.6s
Token: 6,030 tok

#44 xAI: Grok Build 0.1

medium

Biaya: $0.028
Waktu: 81.3s
Token: 14,009 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Trik anti-AI	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Step 3.7 Flash	10.0	10.0	100.0%	0		13.40s	696	42,656	0
Grok Build 0.1	8.3	10.0	75.0%	0		7.43s	2,010	220	12,162

Pemrograman	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Step 3.7 Flash	4.0	6.0	22.2%	1		206.21s	6,057	327,340	0
Grok Build 0.1	5.7	9.7	33.3%	0		108.46s	8,304	1,138	161,452

Gabungan	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Step 3.7 Flash	10.0	10.0	100.0%	0		13.01s	13,638	8,802	0
Grok Build 0.1	10.0	10.0	100.0%	0		32.81s	12,909	231	16,917

Parsing dan ekstraksi data	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Step 3.7 Flash	10.0	10.0	100.0%	0		14.72s	7,368	23,113	0
Grok Build 0.1	10.0	10.0	100.0%	0		10.72s	7,761	180	8,876

Spesifik domain	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Step 3.7 Flash	4.1	4.4	44.5%	2		149.64s	783	410,502	0
Grok Build 0.1	5.3	10.0	33.3%	0		158.00s	1,764	492	175,294

Kecerdasan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Step 3.7 Flash	5.5	10.0	0.0%	0		4.17s	510	2,862	0
Grok Build 0.1	4.4	9.9	0.0%	0		18.41s	825	76	6,345

Kepatuhan instruksi	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Step 3.7 Flash	9.8	10.0	100.0%	0		1.52s	705	2,010	0
Grok Build 0.1	9.8	10.0	100.0%	0		12.36s	1,362	57	9,599

Pemecahan teka-teki	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Step 3.7 Flash	5.3	7.2	44.4%	1		10.22s	711	25,422	0
Grok Build 0.1	7.7	10.0	66.7%	0		18.26s	1,689	195	20,841

Pemanggilan alat	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Step 3.7 Flash	10.0	10.0	100.0%	0		2.79s	7,701	1,172	0
Grok Build 0.1	10.0	10.0	100.0%	0		13.12s	7,263	180	4,969

Pengetahuan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Step 3.7 Flash	3.0	10.0	0.0%	0		149.34s	222	147,476	0
Grok Build 0.1	3.0	10.0	0.0%	0		53.51s	531	13	21,563

Perbandingan Cepat

Ganti Pasangan Perbandingan

Step 3.7 FlashhighvsGLM 5.1medium DeepSeek V4 ProhighvsGrok Build 0.1medium Laguna XS 2.1mediumTersedia gratisvsStep 3.7 Flashhigh Step 3.7 FlashhighvsGLM 5.2none Qwen3.7 PlusnonevsStep 3.7 Flashhigh Kimi K2.7 CodemediumvsStep 3.7 Flashhigh GPT-5.3 ChatnonevsGrok Build 0.1medium Gemma 4 26B A4BmediumTersedia gratisvsStep 3.7 Flashhigh DeepSeek V4 PrononevsStep 3.7 Flashhigh Gemini 3.5 FlashnonevsStep 3.7 Flashhigh Step 3.7 FlashlowvsGrok Build 0.1medium Claude Opus 4.8nonevsStep 3.7 Flashhigh