Navigasi
AI BENCHY
Advertise here

Gemini 3.1 Flash Lite Preview (low) vs Mercury 2.5 Preview (high)

Skor rata-rata hampir imbang di 6.6 vs 6.6. Mercury 2.5 Preview (high) memiliki biaya benchmark lebih rendah di $0.030 vs $0.646. Mercury 2.5 Preview (high) lebih cepat di 4.01s vs 16.67s, dengan tingkat keberhasilan 63.6% vs 65.2%.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-09-02

Peringkat
#153
Total token output
412,179
Waktu respons (rata-rata)
16.67s
Total Biaya
$0.646
Peringkat
#157
Total token output
163,505
Waktu respons (rata-rata)
4.01s
Total Biaya
$0.030
Model yang direkomendasikan Mercury 2.5 Preview (high)

It has the best score here (6.6), while costing about 22.2x less than Gemini 3.1 Flash Lite Preview (low).

Perbandingan terperinci

Metrik Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview low Rilis: 2026-03-03 Mercury 2.5 Preview Mercury 2.5 Preview high Rilis: 2026-09-02
Skor 6.6 6.6
Peringkat #153 #157
Keandalan 10.0 10.0
Konsistensi 10.0 8.2
Percobaan 66/66 66/66
Tes benar
Tingkat lulus per percobaan 63.6% 65.2%
Tes tidak stabil 0 5
Total Run 66 66
Biaya per hasil 4.613 0.243
Total Biaya $0.646 $0.030
Harga input $0.250 / 1M $0.040 / 1M
Harga output $1.500 / 1M $0.150 / 1M
Total token input 110,196 115,759
Token output 14,717 2,562
Token penalaran 397,462 160,943
Waktu respons (rata-rata) 16.67s 4.01s
Waktu respons (maks) 309.35s 17.71s
Waktu respons (total) 366.69s 88.25s
Parameter ~150B total (~10B aktif) ~100B
Ketersediaan Tertutup Tertutup

Showcase generasi model

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#153 Gemini 3.1 Flash Lite Preview

low
Biaya
$0.002
Waktu
3.7s
Token
1,203 tok

#157 Mercury 2.5 Preview

high
Biaya
$0.001
Waktu
4.5s
Token
3,851 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
Gemini 3.1 Flash Lite Preview 5.5 10.0 33.3% 0 1.39s 8,138 660 1,060
Mercury 2.5 Preview 6.7 7.8 55.6% 1 6.13s 7,751 485 42,569

Perbandingan Cepat

Ganti Pasangan Perbandingan