Navigasi
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Step 3.7 Flash (low) vs Grok Build 0.1 (medium)

Grok Build 0.1 (medium) unggul dalam skor rata-rata dengan 7.6 vs 7.3. Step 3.7 Flash (low) memiliki biaya benchmark lebih rendah di $0.454 vs $1.097. Step 3.7 Flash (low) lebih cepat di 20.68s vs 52.06s, dengan tingkat keberhasilan 68.2% vs 63.6%.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-07-28

Peringkat
#77
Total token output
376,581
Waktu respons (rata-rata)
20.68s
Total Biaya
$0.454
Peringkat
#56
Total token output
494,663
Waktu respons (rata-rata)
52.06s
Total Biaya
$1.097
Model yang direkomendasikan Step 3.7 Flash (low)

Its score stays close to the best score here (7.3 vs 7.6), while costing about 2.4x less than Grok Build 0.1 (medium).

Perbandingan terperinci

Metrik Step 3.7 Flash Step 3.7 Flash low Rilis: 2026-05-29 Grok Build 0.1 Grok Build 0.1 medium Rilis: 2026-05-21
Skor 7.3 7.6
Peringkat #77 #56
Keandalan 10.0 10.0
Konsistensi 8.1 10.0
Tes benar
Tingkat lulus per percobaan 68.2% 63.6%
Tes tidak stabil 5 0
Total Run 66 66
Biaya per hasil 3.782 7.830
Total Biaya $0.454 $1.097
Harga input $0.200 / 1M $1.000 / 1M
Harga output $1.150 / 1M $2.000 / 1M
Total token input 103,833 106,751
Token output 376,581 7,993
Token penalaran 0 486,670
Waktu respons (rata-rata) 20.68s 52.06s
Waktu respons (maks) 124.75s 252.69s
Waktu respons (total) 455.01s 1145.27s

Showcase generasi model

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#77 Step 3.7 Flash

low
SVG tidak valid
Biaya
$0.004
Waktu
25.3s
Token
3,072 tok

#56 xAI: Grok Build 0.1

medium
Biaya
$0.028
Waktu
81.3s
Token
14,009 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
Step 3.7 Flash 8.2 7.2 88.9% 1 9.46s 7,437 18,685 0
Grok Build 0.1 5.7 9.7 33.3% 0 108.46s 8,304 1,138 161,452

Perbandingan Cepat

Ganti Pasangan Perbandingan