AI BENCHY Compare

Model yang Dibandingkan

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-03-12

Metrik	Grok 4.20 Beta Grok 4.20 Beta medium Rilis: 2026-03-12	Grok 4.1 Fast Grok 4.1 Fast medium Rilis: 2025-11-19	Hunter Alpha Hunter Alpha medium Rilis: Tanggal rilis tidak diketahui

Metrik	Grok 4.20 Beta Grok 4.20 Beta medium Rilis: 2026-03-12	Grok 4.1 Fast Grok 4.1 Fast medium Rilis: 2025-11-19	Hunter Alpha Hunter Alpha medium Rilis: Tanggal rilis tidak diketahui
Peringkat	#24	#32	#35
Skor Rata-rata	7.0	6.2	5.9
Konsistensi	9.0	7.9	7.6
Biaya per hasil	5.989	0.563	0.000
Total Biaya	$0.599	$0.051	$0.000
Tes benar
Tingkat lulus per percobaan	70.8%	66.7%	68.8%
Tes tidak stabil	2	4	5
Total Run	48	48	48
Token output	1,481	1,183	4,686
Token penalaran	86,628	83,875	17,821
Waktu respons (rata-rata)	8.89s	26.35s	10.71s
Waktu respons (maks)	24.21s	121.79s	30.53s
Waktu respons (total)	142.18s	237.11s	171.41s

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor Rata-rata vs Waktu respons (rata-rata)

Total token output

Skor Rata-rata vs Total token output

Rincian Kategori

Trik anti-AI	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Grok 4.20 Beta	7.0	7.2	88.9%	1		3.19s	262	6,289
Grok 4.1 Fast	10.0	10.0	100.0%	0		5.65s	102	4,021
Hunter Alpha	7.0	7.2	88.9%	1		4.93s	441	1,003

Gabungan	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Grok 4.20 Beta	10.0	10.0	100.0%	0		20.93s	227	12,212
Grok 4.1 Fast	10.0	10.0	100.0%	0		37.64s	261	12,272
Hunter Alpha	10.0	1.6	66.7%	1		30.53s	792	3,456

Parsing dan ekstraksi data	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Grok 4.20 Beta	9.9	10.0	100.0%	0		4.01s	180	5,281
Grok 4.1 Fast	9.9	10.0	100.0%	0		6.63s	180	5,409
Hunter Alpha	9.9	10.0	100.0%	0		23.16s	1,488	8,017

Spesifik domain	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Grok 4.20 Beta	4.0	10.0	33.3%	0		21.33s	251	40,255
Grok 4.1 Fast	4.0	4.4	66.7%	2		121.79s	11	37,657
Hunter Alpha	10.0	10.0	0.0%	0		10.52s	892	2,406

Kecerdasan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Grok 4.20 Beta	10.0	10.0	100.0%	0		5.78s	72	3,440
Grok 4.1 Fast	3.0	9.9	0.0%	0		16.25s	127	3,456
Hunter Alpha	8.0	3.7	66.7%	1		6.44s	116	260

Kepatuhan instruksi	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Grok 4.20 Beta	9.0	10.0	50.0%	0		4.97s	57	7,107
Grok 4.1 Fast	5.5	10.0	50.0%	0		5.30s	55	3,489
Hunter Alpha	9.5	10.0	100.0%	0		4.18s	208	465

Puzzle Solving	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Grok 4.20 Beta	7.0	7.2	88.9%	1		3.85s	249	6,660
Grok 4.1 Fast	4.0	7.2	44.4%	1		8.08s	187	6,086
Hunter Alpha	4.3	4.7	66.7%	2		5.36s	441	1,310

Pemanggilan alat	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Grok 4.20 Beta	10.0	10.0	0.0%	0		12.39s	183	5,384
Grok 4.1 Fast	10.0	1.6	33.3%	1		27.71s	260	11,485
Hunter Alpha	10.0	10.0	100.0%	0		17.33s	308	904

Perbandingan Cepat

Ganti Pasangan Perbandingan

Qwen3.5 Plus 2026-02-15nonevsGrok 4.1 Fastmedium Gemini 3.1 Flash Lite PreviewnonevsGrok 4.20 Betamedium Hunter AlphamediumvsGLM 5none Grok 4.1 FastmediumvsGLM 5none Gemini 3 Flash PreviewnonevsGrok 4.20 Betamedium Claude Sonnet 4.6nonevsGrok 4.20 Betamedium GPT-5.3 ChatnonevsGrok 4.20 Betamedium Hunter AlphamediumvsQwen3.5 Plus 2026-02-15none Gemini 3.1 Flash Lite PreviewlowvsGrok 4.20 Betamedium DeepSeek V3.2nonevsHunter Alphamedium GPT-5.2 ChatnonevsGrok 4.20 Betamedium Claude Sonnet 4.6nonevsGrok 4.1 Fastmedium