Navigasi
Advertise here

Gemma 4 31B (medium) vs GPT-5.6 Luna (low)

Skor rata-rata hampir imbang di 6.9 vs 6.9. GPT-5.6 Luna (low) memiliki biaya benchmark lebih rendah di $0.049 vs $0.144. GPT-5.6 Luna (low) lebih cepat di 6.96s vs 78.76s, dengan tingkat keberhasilan 66.7% vs 56.5%.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-10-07

Model yang Dibandingkan

Peringkat
#175
Total token output
277,315
Waktu respons (rata-rata)
78.76s
Total Biaya
$0.144
Peringkat
#176
Total token output
28,001
Waktu respons (rata-rata)
6.96s
Total Biaya
$0.049
Model yang direkomendasikan GPT-5.6 Luna (low)

It has the best score here (6.9), while costing about 2.9x less than Gemma 4 31B (medium).

Perbandingan terperinci

Metrik Gemma 4 31B Gemma 4 31B medium Rilis: 2026-04-02 Tersedia gratis GPT-5.6 Luna GPT-5.6 Luna low Rilis: 2026-07-09
Skor 6.9 6.9
Peringkat #175 #176
Keandalan 10.0 10.0
Konsistensi 8.7 8.3
Percobaan 69/69 69/69
Tes benar
Tingkat lulus per percobaan 66.7% 56.5%
Tes tidak stabil 3 5
Total Run 69 69
Biaya per hasil 1.195 2.428
Total Biaya $0.144 $0.049
Harga input $0.090 / 1M $0.200 / 1M
Harga output $0.340 / 1M $1.200 / 1M
Harga baca cache $0.050 / 1M $0.020 / 1M
Harga tulis cache T/A $0.250 / 1M
Total token input 251,164 202,680
Token output 36,112 9,230
Token penalaran 241,203 18,771
Waktu respons (rata-rata) 78.76s 6.96s
Waktu respons (maks) 437.40s 45.74s
Waktu respons (total) 1653.96s 160.19s
Parameter 30.7B ~400B total (~17B aktif)
Ketersediaan Sumber terbuka Tertutup

Harga cache berlaku untuk token input. Pembacaan memakai kembali prompt tersimpan; penulisan menyimpannya dan dapat menambah biaya. Token output menggunakan harga output.

Showcase generasi model

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#175 Gemma 4 31B

medium
Biaya
$0.002
Waktu
45.7s
Token
2,696 tok

#176 GPT-5.6 Luna

low
Biaya
$0.011
Waktu
10.2s
Token
1,897 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
Gemma 4 31B 4.3 5.8 22.2% 1 219.76s 5,568 11,098 33,212
GPT-5.6 Luna 5.5 10.0 33.3% 0 4.61s 7,302 557 3,535

Ganti Pasangan Perbandingan