AI BENCHY
Advertise here
#10

Gemini 3.1 Flash Lite Preview

Google Rilis: 2026-03-03 Diuji pada: 2026-05-06 14:01 google/gemini-3.1-flash-lite-preview::high
~150B total (~10B aktif)MoETertutupPerkiraan

Ringkasan

Gemini 3.1 Flash Lite Preview mendapat skor 8.6 di AI BENCHY dan berada di peringkat #10. Model ini memiliki reliabilitas T/A, tingkat keberhasilan 81.3%, total biaya $2.310, dan waktu respons rata-rata 68.83s.

Yang membuat Gemini 3.1 Flash Lite Preview unik: Model ini memakai token reasoning yang sangat tinggi, yang bisa menjelaskan run yang lebih lambat atau lebih mahal.

Model diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.

Catatan identitas

Gemini 3.1 Flash Lite Preview adalah versi pratinjau dari Google: Gemini 3.1 Flash Lite.

Fakta model

Ditelaah pada 2026-08-12

Perkiraan
Parameter
~150B total (~10B aktif)
Arsitektur
MoE
Ketersediaan
Tertutup
Lisensi
-

Perkiraan terbaik berdasarkan bukti publik; penyedia tidak mengungkapkan semua nilai.

Skor

8.6

Konsistensi

10.0

Keandalan

T/A

Total token output

1,534,593

Total token input

0

Harga input

$0.250 / 1M

Harga output

$1.500 / 1M

Tes benar

Tes Salah: 3

Tingkat lulus per percobaan: 81.3%

Tes tidak stabil

0

Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).

Waktu respons (rata-rata)

68.83s

Waktu respons (maks): 280.52s

Waktu respons (total): 1101.32s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#10 Gemini 3.1 Flash Lite Preview

high
Biaya
$0.096
Waktu
133.9s
Token
63,687 tok

Riwayat run

Diuji pada Skor Keandalan Tes benar Total Biaya Bandingkan
2026-05-06 14:01 Uji ulang 5.3 T/A $2.310 Bandingkan
2026-05-06 14:01 Uji ulang 5.3 T/A $2.310 Bandingkan
2026-05-06 14:01 Uji ulang 8.6 T/A $2.310 Bandingkan
2026-05-06 14:01 Uji ulang 8.6 T/A $2.310 Bandingkan
2026-05-06 14:01 Suite berubah 8.6 T/A $2.310 Run saat ini
2026-04-10 23:27 Run pertama yang tercatat 8.4 T/A $2.310 Bandingkan

Run ini menggunakan suite benchmark yang berbeda. Perhatikan perubahan suite saat membaca pergerakan historis.

Perbandingan run

RunCakupan benchmarkSkorKonsistensiKeandalanTes benarTes tidak stabilTotal token outputTotal token inputTotal BiayaWaktu respons (rata-rata)
2026-05-06 14:01 · Suite berubah48/48 percobaan8.610.0T/A13/1601,534,5930$2.31068.83s
2026-05-06 14:01 · Uji ulang48/48 percobaan5.37.3T/A13/1601,534,59328,980$2.31068.14s
Selisih+3.3+2.7000-28980+$0.001+690ms

Grafik

Pilih model pertama, lalu klik model kedua untuk membuka halaman berdampingan.

Total token output

Skor vs Total token output

Rincian Kategori

Kategori Skor Konsistensi Tes benar
Trik anti-AI 10.0 10.0
Gabungan 10.0 10.0
Parsing dan ekstraksi data 10.0 10.0
Spesifik domain 5.3 10.0
Kecerdasan umum 10.0 10.0
Kepatuhan instruksi 9.8 10.0
Pemecahan teka-teki 7.7 10.0
Pemanggilan alat 10.0 10.0

Model yang Dibandingkan