AI BENCHY Compare

Google: Gemini 3.1 Pro Preview vs Google: Gemma 4 31B

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-04-02

Metrik	Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Rilis: 2026-02-19	Gemma 4 31B Gemma 4 31B none Rilis: 2026-04-02

Metrik	Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Rilis: 2026-02-19	Gemma 4 31B Gemma 4 31B none Rilis: 2026-04-02
Skor	9.6	6.7
Peringkat	#2	#47
Konsistensi	10.0	10.0
Tes benar
Tingkat lulus per percobaan	94.1%	52.9%
Tes tidak stabil	0	0
Total Run	51	51
Biaya per hasil	3.257	0.023
Total Biaya	$0.522	$0.002
Harga input	$2.000 / 1M	$0.140 / 1M
Harga output	$12.000 / 1M	$0.400 / 1M
Token output	1,527	660
Token penalaran	36,341	0
Waktu respons (rata-rata)	15.56s	2.55s
Waktu respons (maks)	40.61s	4.68s
Waktu respons (total)	155.64s	38.20s

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Trik anti-AI	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		7.90s	112	3,218
Gemma 4 31B	6.5	10.0	50.0%	0		1.85s	45	0

Gabungan	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Gemini 3.1 Pro Preview	9.5	10.0	100.0%	0		40.61s	432	9,281
Gemma 4 31B	3.0	10.0	0.0%	0		0ms	0	0

Parsing dan ekstraksi data	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		7.72s	279	3,904
Gemma 4 31B	10.0	10.0	100.0%	0		2.25s	285	0

Spesifik domain	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Gemini 3.1 Pro Preview	7.7	10.0	66.7%	0		32.73s	18	12,424
Gemma 4 31B	7.7	10.0	66.7%	0		3.22s	27	0

Kecerdasan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		11.77s	108	1,179
Gemma 4 31B	10.0	10.0	100.0%	0		2.09s	117	0

Kepatuhan instruksi	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		9.56s	72	2,236
Gemma 4 31B	6.5	10.0	50.0%	0		2.84s	78	0

Puzzle Solving	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		7.15s	232	3,117
Gemma 4 31B	5.5	10.0	33.3%	0		2.95s	108	0

Pemanggilan alat	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		23.15s	274	982
Gemma 4 31B	3.0	10.0	0.0%	0		0ms	0	0

Perbandingan Cepat

Ganti Pasangan Perbandingan

Gemma 4 31BnonevsGPT-5 Minimedium Gemma 4 31BnonevsNemotron 3 SupermediumTersedia gratis Gemma 4 31BnonevsGrok 4.1 Fastmedium Gemma 4 31BnonevsHunter Alphamedium Gemma 4 31BnonevsGPT-5.4 Minimedium Gemma 4 31BnonevsGrok 4.20medium Gemma 4 31BnonevsMercury 2medium Gemma 4 31BnonevsGPT-5 Nanomedium Gemma 4 31BnonevsKimi K2.5medium Gemma 4 31BnonevsGrok 4.20 Multi Agent Betamedium Gemma 4 31BnonevsQwen3.5-35B-A3Bmedium Gemma 4 31BnonevsGPT-5.2medium