AI BENCHY Compare

Google: Gemini 3.1 Flash Lite Preview vs Qwen: Qwen3.7 Plus

Ringkasan

Perbandingan benchmark Gemini 3.1 Flash Lite Preview vs Qwen3.7 Plus: Gemini 3.1 Flash Lite Preview unggul dalam skor rata-rata dengan 7.8 vs 7.2. Qwen3.7 Plus memiliki biaya benchmark lebih rendah di $0.023 vs $0.068. Qwen3.7 Plus lebih cepat di 2.85s vs 3.96s, dengan tingkat keberhasilan 61.9% vs 47.6%.

Model yang direkomendasikan: Qwen3.7 Plus - Its score stays close to the best score here (7.2 vs 7.8), while costing about 3.1x less than Gemini 3.1 Flash Lite Preview.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-06-18

Metrik	Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview medium Rilis: 2026-03-03	Qwen3.7 Plus Qwen3.7 Plus none Rilis: 2026-06-03

Metrik	Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview medium Rilis: 2026-03-03	Qwen3.7 Plus Qwen3.7 Plus none Rilis: 2026-06-03
Skor	7.8	7.2
Peringkat	#32	#60
Keandalan	10.0	10.0
Konsistensi	10.0	10.0
Tes benar
Tingkat lulus per percobaan	61.9%	47.6%
Tes tidak stabil	0	0
Total Run	63	63
Biaya per hasil	0.523	0.276
Total Biaya	$0.068	$0.023
Harga input	$0.250 / 1M	$0.320 / 1M
Harga output	$1.500 / 1M	$1.280 / 1M
Total token input	37,786	42,510
Token output	2,210	6,578
Token penalaran	36,744	0
Waktu respons (rata-rata)	3.96s	2.85s
Waktu respons (maks)	14.93s	29.38s
Waktu respons (total)	83.06s	59.86s

Showcase generasi

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#32 Gemini 3.1 Flash Lite Preview

medium

Biaya: $0.003
Waktu: 5.2s
Token: 1,944 tok

#60 Qwen3.7 Plus

none

Biaya: $0.019
Waktu: 213.5s
Token: 11,960 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Trik anti-AI	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Gemini 3.1 Flash Lite Preview	9.1	10.0	75.0%	0		2.33s	512	570	4,305
Qwen3.7 Plus	6.5	10.0	50.0%	0		1.38s	696	349	0

Pemrograman	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Gemini 3.1 Flash Lite Preview	5.5	10.0	33.3%	0		4.09s	8,126	461	8,597
Qwen3.7 Plus	5.5	10.0	33.3%	0		2.15s	7,911	639	0

Gabungan	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Gemini 3.1 Flash Lite Preview	10.0	10.0	100.0%	0		14.93s	13,403	327	7,347
Qwen3.7 Plus	10.0	10.0	100.0%	0		29.38s	14,952	4,505	0

Parsing dan ekstraksi data	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Gemini 3.1 Flash Lite Preview	10.0	10.0	100.0%	0		2.29s	7,362	279	2,952
Qwen3.7 Plus	10.0	10.0	100.0%	0		1.43s	7,794	243	0

Spesifik domain	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Gemini 3.1 Flash Lite Preview	3.0	10.0	0.0%	0		4.21s	639	18	5,325
Qwen3.7 Plus	3.0	10.0	0.0%	0		868ms	789	18	0

Kecerdasan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Gemini 3.1 Flash Lite Preview	10.0	10.0	100.0%	0		3.16s	488	96	1,488
Qwen3.7 Plus	5.3	10.0	0.0%	0		1.33s	522	78	0

Kepatuhan instruksi	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Gemini 3.1 Flash Lite Preview	10.0	10.0	100.0%	0		1.91s	621	72	2,121
Qwen3.7 Plus	6.3	10.0	50.0%	0		929ms	711	72	0

Pemecahan teka-teki	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Gemini 3.1 Flash Lite Preview	7.7	10.0	66.7%	0		5.30s	566	141	1,896
Qwen3.7 Plus	7.7	10.0	66.7%	0		1.71s	714	443	0

Pemanggilan alat	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Gemini 3.1 Flash Lite Preview	10.0	10.0	100.0%	0		3.80s	5,909	234	912
Qwen3.7 Plus	10.0	10.0	100.0%	0		3.54s	8,211	222	0

Pengetahuan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Gemini 3.1 Flash Lite Preview	3.0	10.0	0.0%	0		2.68s	160	12	1,801
Qwen3.7 Plus	3.0	10.0	0.0%	0		1.21s	210	9	0

Perbandingan Cepat

Ganti Pasangan Perbandingan

Gemma 4 26B A4BmediumTersedia gratisvsQwen3.7 Plusnone Qwen3.7 PlusnonevsStep 3.7 Flashhigh Qwen3.7 PlusnonevsGLM 5.1medium Gemini 3.1 Flash Lite PreviewmediumvsStep 3.7 Flashlow Kimi K2.7 CodemediumvsQwen3.7 Plusnone DeepSeek V4 ProhighvsGemini 3.1 Flash Lite Previewmedium Qwen3.7 PlusnonevsGrok 4.20medium Gemini 3 Flash PreviewlowvsQwen3.7 Plusnone Qwen3.7 PlusnonevsMiMo-V2.5-Promedium Seed-2.0-MinimediumvsQwen3.7 Plusnone Gemini 3.1 Flash Lite PreviewmediumvsGPT-5.3 Chatnone DeepSeek V3.2mediumvsQwen3.7 Plusnone