Navigasi
AI BENCHY
Advertise here

Gemini 3.1 Flash Lite Preview (medium) vs GPT-5.6 Luna (medium)

Skor rata-rata hampir imbang di 7.4 vs 7.4. GPT-5.6 Luna (medium) memiliki biaya benchmark lebih rendah di $0.072 vs $0.117. Gemini 3.1 Flash Lite Preview (medium) lebih cepat di 4.59s vs 7.43s, dengan tingkat keberhasilan 63.6% vs 62.1%.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-08-20

Peringkat
#90
Total token output
57,778
Waktu respons (rata-rata)
4.59s
Total Biaya
$0.117
Peringkat
#93
Total token output
44,525
Waktu respons (rata-rata)
7.43s
Total Biaya
$0.072
Model yang direkomendasikan GPT-5.6 Luna (medium)

It has the best score here (7.4), while costing about 1.6x less than Gemini 3.1 Flash Lite Preview (medium).

Perbandingan terperinci

Metrik Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview medium Rilis: 2026-03-03 GPT-5.6 Luna GPT-5.6 Luna medium Rilis: 2026-07-09
Skor 7.4 7.4
Peringkat #90 #93
Keandalan 10.0 10.0
Konsistensi 9.9 9.2
Percobaan 66/66 66/66
Tes benar
Tingkat lulus per percobaan 63.6% 62.1%
Tes tidak stabil 0 2
Total Run 66 66
Biaya per hasil 0.829 2.601
Total Biaya $0.117 $0.072
Harga input $0.250 / 1M $0.200 / 1M
Harga output $1.500 / 1M $1.200 / 1M
Total token input 117,493 89,685
Token output 10,589 5,701
Token penalaran 47,189 38,824
Waktu respons (rata-rata) 4.59s 7.43s
Waktu respons (maks) 18.34s 29.85s
Waktu respons (total) 101.04s 163.54s
Parameter ~150B total (~10B aktif) ~400B total (~17B aktif)
Ketersediaan Tertutup Tertutup

Showcase generasi model

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#90 Gemini 3.1 Flash Lite Preview

medium
Biaya
$0.003
Waktu
5.2s
Token
1,944 tok

#93 GPT-5.6 Luna

medium
Biaya
$0.014
Waktu
14.6s
Token
2,362 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
Gemini 3.1 Flash Lite Preview 5.5 10.0 33.3% 0 4.09s 8,126 461 8,597
GPT-5.6 Luna 5.4 7.2 44.4% 1 10.38s 7,302 564 9,928

Perbandingan Cepat

Ganti Pasangan Perbandingan