Navigasi
AI BENCHY
Advertise here

Qwen3.7 Flash (medium) vs Grok 4.20 (medium)

Grok 4.20 (medium) unggul dalam skor rata-rata dengan 7.0 vs 6.9. Qwen3.7 Flash (medium) memiliki biaya benchmark lebih rendah di $0.065 vs $0.805. Grok 4.20 (medium) lebih cepat di 32.56s vs 47.38s, dengan tingkat keberhasilan 63.6% vs 60.6%.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-08-15

Peringkat
#124
Total token output
470,076
Waktu respons (rata-rata)
47.38s
Total Biaya
$0.065
Peringkat
#120
Total token output
270,259
Waktu respons (rata-rata)
32.56s
Total Biaya
$0.805
Model yang direkomendasikan Qwen3.7 Flash (medium)

Its score stays close to the best score here (6.9 vs 7.0), while costing about 12.5x less than Grok 4.20 (medium).

Perbandingan terperinci

Metrik Qwen3.7 Flash Qwen3.7 Flash medium Rilis: 2026-07-28 Grok 4.20 Grok 4.20 medium Rilis: 2026-03-31
Skor 6.9 7.0
Peringkat #124 #120
Keandalan 10.0 10.0
Konsistensi 7.5 8.2
Percobaan 66/66 66/66
Tes benar
Tingkat lulus per percobaan 63.6% 60.6%
Tes tidak stabil 7 5
Total Run 66 66
Biaya per hasil 0.646 10.365
Total Biaya $0.065 $0.805
Harga input $0.030 / 1M $1.250 / 1M
Harga output $0.130 / 1M $2.500 / 1M
Total token input 114,477 102,986
Token output 12,786 5,860
Token penalaran 457,290 264,399
Waktu respons (rata-rata) 47.38s 32.56s
Waktu respons (maks) 593.64s 199.66s
Waktu respons (total) 1042.43s 716.36s
Parameter ~35B total (~3B aktif) ~1T total (~100B aktif)
Ketersediaan Tertutup Tertutup

Showcase generasi model

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#124 Qwen3.7 Flash

medium
SVG tidak valid
Biaya
$0.000
Waktu
600.0s
Token
0 tok

#120 SpaceXAI: Grok 4.20

medium
Biaya
$0.041
Waktu
110.3s
Token
16,336 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
Qwen3.7 Flash 6.2 6.9 55.6% 1 46.78s 7,893 563 61,902
Grok 4.20 6.3 6.6 55.6% 1 109.93s 8,307 268 103,150

Perbandingan Cepat

Ganti Pasangan Perbandingan