AI BENCHY Compare

Google: Gemini 3.5 Flash vs OpenAI: GPT-5.2

Ringkasan

Perbandingan benchmark Gemini 3.5 Flash vs GPT-5.2: Gemini 3.5 Flash unggul dalam skor rata-rata dengan 9.2 vs 8.4. Gemini 3.5 Flash memiliki biaya benchmark lebih rendah di $0.349 vs $0.548. Gemini 3.5 Flash lebih cepat di 3.27s vs 16.88s, dengan tingkat keberhasilan 90.5% vs 71.4%.

Model yang direkomendasikan: Gemini 3.5 Flash - It has the best score here (9.2), while costing about 1.6x less than GPT-5.2.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-07-02

Metrik	Gemini 3.5 Flash Gemini 3.5 Flash low Rilis: 2026-05-19	GPT-5.2 GPT-5.2 medium Rilis: 2025-12-11

Metrik	Gemini 3.5 Flash Gemini 3.5 Flash low Rilis: 2026-05-19	GPT-5.2 GPT-5.2 medium Rilis: 2025-12-11
Skor	9.2	8.4
Peringkat	#5	#22
Keandalan	10.0	10.0
Konsistensi	10.0	8.4
Tes benar
Tingkat lulus per percobaan	90.5%	71.4%
Tes tidak stabil	0	4
Total Run	63	63
Biaya per hasil	1.834	4.209
Total Biaya	$0.349	$0.548
Harga input	$1.500 / 1M	$1.750 / 1M
Harga output	$9.000 / 1M	$14.000 / 1M
Total token input	36,938	33,967
Token output	2,033	2,901
Token penalaran	30,519	31,932
Waktu respons (rata-rata)	3.27s	16.88s
Waktu respons (maks)	9.05s	77.80s
Waktu respons (total)	68.65s	236.34s

Showcase generasi

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#5 Gemini 3.5 Flash

low

Biaya: $0.068
Waktu: 39.1s
Token: 7,588 tok

#22 GPT-5.2

medium

Biaya: $0.047
Waktu: 49.2s
Token: 3,396 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Trik anti-AI	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Gemini 3.5 Flash	10.0	10.0	100.0%	0		2.52s	494	209	2,536
GPT-5.2	6.5	8.0	58.3%	1		7.81s	606	567	2,002

Pemrograman	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Gemini 3.5 Flash	7.8	10.0	66.7%	0		6.71s	8,118	458	13,420
GPT-5.2	10.0	10.0	100.0%	0		22.73s	7,302	511	11,912

Gabungan	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Gemini 3.5 Flash	10.0	10.0	100.0%	0		6.44s	12,873	351	3,050
GPT-5.2	10.0	10.0	100.0%	0		14.06s	11,019	291	1,757

Parsing dan ekstraksi data	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Gemini 3.5 Flash	10.0	10.0	100.0%	0		1.81s	7,548	279	1,164
GPT-5.2	10.0	10.0	100.0%	0		3.15s	7,140	234	420

Spesifik domain	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Gemini 3.5 Flash	7.7	10.0	66.7%	0		3.39s	633	12	4,538
GPT-5.2	5.9	7.2	55.6%	1		77.80s	473	42	10,342

Kecerdasan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Gemini 3.5 Flash	10.0	10.0	100.0%	0		2.27s	486	119	916
GPT-5.2	3.7	9.7	0.0%	0		4.32s	477	162	269

Kepatuhan instruksi	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Gemini 3.5 Flash	9.9	10.0	100.0%	0		1.86s	615	71	1,652
GPT-5.2	9.9	10.0	100.0%	0		3.12s	660	94	614

Pemecahan teka-teki	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Gemini 3.5 Flash	10.0	10.0	100.0%	0		2.35s	558	288	2,150
GPT-5.2	7.5	7.3	77.8%	1		5.80s	642	735	924

Pemanggilan alat	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Gemini 3.5 Flash	10.0	10.0	100.0%	0		3.27s	5,457	234	403
GPT-5.2	4.7	1.6	66.7%	1		10.30s	5,453	239	469

Pengetahuan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Gemini 3.5 Flash	10.0	10.0	100.0%	0		1.88s	156	12	690
GPT-5.2	3.0	10.0	0.0%	0		28.18s	195	26	3,223

Perbandingan Cepat

Ganti Pasangan Perbandingan

Claude Fable 5mediumvsGemini 3.5 Flashlow DeepSeek V4 FlashhighvsGPT-5.2medium Gemini 3.5 FlashlowvsQwen3.7 Maxmedium Gemini 3.5 FlashlowvsGPT-5.5medium Gemini 3.5 FlashlowvsGPT-5.3-Codexmedium Gemini 3.5 FlashlowvsQwen3.6 Max Previewmedium Claude Opus 4.8mediumvsGemini 3.5 Flashlow Claude Opus 4.7mediumvsGemini 3.5 Flashlow Gemini 3.5 FlashlowvsGLM 5.2medium Claude Opus 4.8lowvsGPT-5.2medium GPT-5.2mediumvsStep 3.7 Flashlow Gemini 3.5 FlashlowvsGLM 5medium