Perbandingan benchmark Gemini 3 Flash Preview vs Laguna M.1: Gemini 3 Flash Preview unggul dalam skor rata-rata dengan 9.6 vs 6.0. Laguna M.1 memiliki biaya benchmark lebih rendah di $0.000 vs $0.667. Laguna M.1 lebih cepat di 2.89s vs 18.64s, dengan tingkat keberhasilan 98.4% vs 31.6%.
Model yang direkomendasikan: Gemini 3 Flash Preview - It has the strongest score in this comparison (9.6) and the best overall balance of cost and response time across all 2 models.
Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-06-12
Laguna M.1Laguna M.1noneModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.Rilis: 2026-04-28Tersedia gratis
Skor
9.6Skor rata-rata di semua tes benchmark.…
6.0Skor rata-rata di semua tes benchmark.…
Peringkat
#2
#101
Keandalan
10.0Skor sukses percobaan pertama: 10.0 berarti tidak ada kegagalan API target atau batas laju yang dapat dicoba ulang sebelum panggilan berhasil; kegagalan yang tercatat menurunkan skor.…
9.8Skor sukses percobaan pertama: 10.0 berarti tidak ada kegagalan API target atau batas laju yang dapat dicoba ulang sebelum panggilan berhasil; kegagalan yang tercatat menurunkan skor.…
Konsistensi
9.7Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
8.8Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
Tes benar
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)18.64sWaktu respons (maks)117.26sWaktu respons (total)391.35sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 10Kesalahan API: 4Pemanggilan alat tidak valid: 1Waktu respons (rata-rata)2.89sWaktu respons (maks)15.42sWaktu respons (total)43.28sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
Tingkat lulus per percobaan
98.4%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
31.6%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
Tes tidak stabil
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
3Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Total Run
63Total Run…
57Total Run…
Biaya per hasil
3.335Menampilkan biaya rata-rata per jawaban benchmark yang benar dalam sen (semakin rendah semakin baik).…
0.000Menampilkan biaya rata-rata per jawaban benchmark yang benar dalam sen (semakin rendah semakin baik).…
Total Biaya
$0.667Total biaya (harga saat ini)…
$0.000Total biaya (harga saat ini)…
Harga input
$0.500 / 1MHarga input…
$0.000 / 1MHarga input…
Harga output
$3.000 / 1MHarga output…
$0.000 / 1MHarga output…
Total token input
37,017Total token input…
38,147Total token input…
Token output
2,006Token output…
2,054Token output…
Token penalaran
214,153Token penalaran…
0Token penalaran…
Waktu respons (rata-rata)
18.64sWaktu respons (rata-rata)…
2.89sWaktu respons (rata-rata)…
Waktu respons (maks)
117.26sWaktu respons (maks)…
15.42sWaktu respons (maks)…
Waktu respons (total)
391.35sWaktu respons (total)…
43.28sWaktu respons (total)…
Generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#2 Gemini 3 Flash Preview
medium
Cost
$0.010
Time
17.9s
Tokens
3,236 tok
#101 Laguna M.1
none
No showcase result has been generated for this model yet.
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)3.88sWaktu respons (maks)5.73sWaktu respons (total)15.53sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
3.88sWaktu respons (rata-rata)…
494Total token input…
330Token output…
3,216Token penalaran…
Laguna M.1Model diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
3.4Skor rata-rata di semua tes benchmark.…
7.9Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
16.7%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 3Kesalahan API: 1Waktu respons (rata-rata)705msWaktu respons (maks)975msWaktu respons (total)2.12sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
7.6Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
88.9%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)84.40sWaktu respons (maks)117.26sWaktu respons (total)253.21sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
84.40sWaktu respons (rata-rata)…
8,122Total token input…
462Token output…
161,084Token penalaran…
Laguna M.1Model diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
7.5Skor rata-rata di semua tes benchmark.…
3.8Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
66.7%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)2.93sWaktu respons (maks)2.93sWaktu respons (total)2.93sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)22.42sWaktu respons (maks)22.42sWaktu respons (total)22.42sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
22.42sWaktu respons (rata-rata)…
12,873Total token input…
351Token output…
10,485Token penalaran…
Laguna M.1Model diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
3.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Pemanggilan alat tidak valid: 1Waktu respons (rata-rata)4.32sWaktu respons (maks)4.32sWaktu respons (total)4.32sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)5.43sWaktu respons (maks)6.18sWaktu respons (total)10.86sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
5.43sWaktu respons (rata-rata)…
7,548Total token input…
279Token output…
4,893Token penalaran…
Laguna M.1Model diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
10.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)3.37sWaktu respons (maks)5.76sWaktu respons (total)6.73sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)15.27sWaktu respons (maks)34.09sWaktu respons (total)45.80sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
15.27sWaktu respons (rata-rata)…
633Total token input…
12Token output…
21,684Token penalaran…
Laguna M.1Model diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
3.6Skor rata-rata di semua tes benchmark.…
7.2Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
22.2%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 3Waktu respons (rata-rata)5.50sWaktu respons (maks)15.42sWaktu respons (total)16.50sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)5.19sWaktu respons (maks)5.19sWaktu respons (total)5.19sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
5.19sWaktu respons (rata-rata)…
486Total token input…
72Token output…
1,905Token penalaran…
Laguna M.1Model diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
3.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Kesalahan API: 1Waktu respons (rata-rata)0msWaktu respons (maks)0msWaktu respons (total)0msTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)4.04sWaktu respons (maks)4.70sWaktu respons (total)8.08sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
4.04sWaktu respons (rata-rata)…
615Total token input…
72Token output…
2,709Token penalaran…
Laguna M.1Model diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
6.3Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
50.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)683msWaktu respons (maks)691msWaktu respons (total)1.37sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)4.05sWaktu respons (maks)5.64sWaktu respons (total)12.15sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
4.05sWaktu respons (rata-rata)…
558Total token input…
183Token output…
4,365Token penalaran…
Laguna M.1Model diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
3.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 2Kesalahan API: 1Waktu respons (rata-rata)891msWaktu respons (maks)1.21sWaktu respons (total)1.78sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)12.60sWaktu respons (maks)12.60sWaktu respons (total)12.60sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
12.60sWaktu respons (rata-rata)…
5,532Total token input…
234Token output…
1,487Token penalaran…
Laguna M.1Model diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
10.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)7.54sWaktu respons (maks)7.54sWaktu respons (total)7.54sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)5.50sWaktu respons (maks)5.50sWaktu respons (total)5.50sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
5.50sWaktu respons (rata-rata)…
156Total token input…
11Token output…
2,325Token penalaran…
Laguna M.1Model diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
3.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Kesalahan API: 1Waktu respons (rata-rata)0msWaktu respons (maks)0msWaktu respons (total)0msTes dianggap lulus penuh hanya jika semua run-nya lulus.…