AI BENCHY Compare

OpenAI: GPT-5.2 Chat vs Qwen: Qwen3.7 Max

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-06-01

Metrik	GPT-5.2 Chat GPT-5.2 Chat none Rilis: 2025-12-11	Qwen3.7 Max Qwen3.7 Max none Rilis: 2026-05-22

Metrik	GPT-5.2 Chat GPT-5.2 Chat none Rilis: 2025-12-11	Qwen3.7 Max Qwen3.7 Max none Rilis: 2026-05-22
Skor	7.9	7.9
Peringkat	#32	#28
Keandalan	10.0	10.0
Konsistensi	8.9	10.0
Tes benar
Tingkat lulus per percobaan	73.3%	70.0%
Tes tidak stabil	3	0
Total Run	60	60
Biaya per hasil	2.703	0.719
Total Biaya	$0.352	$0.051
Harga input	$1.750 / 1M	$1.250 / 1M
Harga output	$14.000 / 1M	$3.750 / 1M
Token output	21,144	1,988
Token penalaran	0	0
Waktu respons (rata-rata)	6.82s	1.30s
Waktu respons (maks)	38.52s	3.92s
Waktu respons (total)	136.34s	25.95s

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Trik anti-AI	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
GPT-5.2 Chat	8.7	7.9	91.7%	1		3.40s	1,807	0
Qwen3.7 Max	6.5	10.0	50.0%	0		1.08s	242	0

Pemrograman	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
GPT-5.2 Chat	8.2	6.7	83.3%	1		8.05s	4,131	0
Qwen3.7 Max	6.8	10.0	50.0%	0		1.39s	576	0

Gabungan	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
GPT-5.2 Chat	10.0	10.0	100.0%	0		9.12s	1,243	0
Qwen3.7 Max	3.0	10.0	0.0%	0		2.17s	171	0

Parsing dan ekstraksi data	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
GPT-5.2 Chat	10.0	10.0	100.0%	0		3.05s	980	0
Qwen3.7 Max	10.0	10.0	100.0%	0		1.35s	243	0

Spesifik domain	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
GPT-5.2 Chat	5.3	10.0	33.3%	0		17.78s	7,810	0
Qwen3.7 Max	7.7	10.0	66.7%	0		975ms	15	0

Kecerdasan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
GPT-5.2 Chat	4.4	3.0	33.3%	1		3.20s	335	0
Qwen3.7 Max	10.0	10.0	100.0%	0		1.04s	120	0

Kepatuhan instruksi	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
GPT-5.2 Chat	9.8	10.0	100.0%	0		5.51s	1,441	0
Qwen3.7 Max	10.0	10.0	100.0%	0		943ms	72	0

Pemecahan teka-teki	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
GPT-5.2 Chat	7.7	10.0	66.7%	0		4.10s	1,603	0
Qwen3.7 Max	10.0	10.0	100.0%	0		1.13s	314	0

Pemanggilan alat	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
GPT-5.2 Chat	10.0	10.0	100.0%	0		4.68s	555	0
Qwen3.7 Max	10.0	10.0	100.0%	0		3.92s	222	0

Pengetahuan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
GPT-5.2 Chat	3.0	10.0	0.0%	0		6.89s	1,239	0
Qwen3.7 Max	3.0	10.0	0.0%	0		856ms	13	0

Perbandingan Cepat

Ganti Pasangan Perbandingan

GPT-5.4mediumvsQwen3.7 Maxnone Qwen3.7 MaxnonevsGLM 5 Turbomedium Qwen3.7 MaxnonevsStep 3.7 Flashmedium Gemma 4 26B A4BmediumTersedia gratisvsGPT-5.2 Chatnone GPT-5.2 ChatnonevsStep 3.7 Flashmedium GPT-5.2 ChatnonevsGLM 5 Turbomedium Gemini 3.5 FlashminimalvsQwen3.7 Maxnone GPT-5.2 ChatnonevsQwen3.5-27Bmedium Gemma 4 26B A4BmediumTersedia gratisvsQwen3.7 Maxnone GPT-5.2 ChatnonevsQwen3.6 35B A3Bmedium Gemma 4 31BmediumTersedia gratisvsQwen3.7 Maxnone GPT-5.2 ChatnonevsGrok 4.3medium