Navigasi
AI BENCHY
AD
Track all your projects in one dashboard. Get ๐Ÿ“Šstats, ๐Ÿ”ฅheatmaps and ๐Ÿ‘€recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Model yang Dibandingkan

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-04-16

Metrik Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview low Rilis: 2026-03-03 Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview medium Rilis: 2026-03-03 Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview high Rilis: 2026-03-03 Gemini 3 Flash Preview Gemini 3 Flash Preview low Rilis: 2025-12-17
Skor 8.1 8.2 8.4 8.8
Peringkat #22 #17 #11 #5
Konsistensi 10.0 10.0 9.6 9.5
Tes benar
Tingkat lulus per percobaan 72.2% 72.2% 77.1% 85.2%
Tes tidak stabil 0 0 1 1
Total Run 54 54 48 54
Biaya per hasil 0.168 0.419 19.243 0.604
Total Biaya $0.022 $0.055 $2.310 $0.091
Harga input $0.250 / 1M $0.250 / 1M $0.250 / 1M $0.500 / 1M
Harga output $1.500 / 1M $1.500 / 1M $1.500 / 1M $3.000 / 1M
Token output 2,247 2,168 1,283 2,018
Token penalaran 8,058 29,030 1,533,310 23,273
Waktu respons (rata-rata) 3.22s 3.74s 68.83s 6.01s
Waktu respons (maks) 11.91s 14.93s 280.52s 14.72s
Waktu respons (total) 58.00s 67.31s 1101.32s 108.12s

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Trik anti-AI Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token output Token penalaran
Gemini 3.1 Flash Lite Preview 8.3 10.0 75.0% 0 2.12s 462 1,638
Gemini 3.1 Flash Lite Preview 9.1 10.0 75.0% 0 2.33s 570 4,305
Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 43.87s 144 193,077
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 3.48s 281 3,082
Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token output Token penalaran
Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 2.20s 630 372
Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 4.34s 431 2,684
Gemini 3.1 Flash Lite Preview - - - - - - - -
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 6.94s 426 2,717
Gabungan Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token output Token penalaran
Gemini 3.1 Flash Lite Preview 3.0 10.0 0.0% 0 11.91s 225 762
Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 14.93s 327 7,347
Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 280.52s 335 380,440
Gemini 3 Flash Preview 3.0 10.0 0.0% 0 3.27s 326 0
Parsing dan ekstraksi data Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token output Token penalaran
Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 3.00s 291 696
Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 2.29s 279 2,952
Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 7.16s 279 6,186
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 9.40s 279 3,656
Spesifik domain Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token output Token penalaran
Gemini 3.1 Flash Lite Preview 5.3 10.0 33.3% 0 2.36s 18 1,212
Gemini 3.1 Flash Lite Preview 3.0 10.0 0.0% 0 4.21s 18 5,325
Gemini 3.1 Flash Lite Preview 5.3 10.0 33.3% 0 127.58s 18 566,202
Gemini 3 Flash Preview 5.3 7.2 44.4% 1 8.05s 12 6,410
Kecerdasan umum Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token output Token penalaran
Gemini 3.1 Flash Lite Preview 4.0 10.0 0.0% 0 1.54s 69 384
Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 3.16s 96 1,488
Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 5.25s 117 3,915
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 3.68s 120 981
Kepatuhan instruksi Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token output Token penalaran
Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 1.49s 72 753
Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 1.91s 72 2,121
Gemini 3.1 Flash Lite Preview 7.9 6.9 66.7% 1 70.07s 69 190,053
Gemini 3 Flash Preview 9.9 10.0 100.0% 0 7.02s 71 2,752
Pemecahan teka-teki Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token output Token penalaran
Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 2.76s 243 1,248
Gemini 3.1 Flash Lite Preview 7.7 10.0 66.7% 0 3.58s 141 1,896
Gemini 3.1 Flash Lite Preview 7.7 10.0 66.7% 0 46.33s 87 190,953
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 6.11s 269 3,260
Pemanggilan alat Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token output Token penalaran
Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 9.54s 237 993
Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 3.80s 234 912
Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 7.73s 234 2,484
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 4.99s 234 415

Perbandingan Cepat

Ganti Pasangan Perbandingan