AI BENCHY Compare

Anthropic: Claude Sonnet 4.6 vs OpenAI: GPT-5 Mini

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-06-01

Metrik	Claude Sonnet 4.6 Claude Sonnet 4.6 none Rilis: 2026-02-17	GPT-5 Mini GPT-5 Mini medium Rilis: 2025-08-07

Metrik	Claude Sonnet 4.6 Claude Sonnet 4.6 none Rilis: 2026-02-17	GPT-5 Mini GPT-5 Mini medium Rilis: 2025-08-07
Skor	7.0	7.2
Peringkat	#78	#73
Keandalan	10.0	10.0
Konsistensi	9.7	9.1
Tes benar
Tingkat lulus per percobaan	58.3%	61.7%
Tes tidak stabil	1	2
Total Run	60	60
Biaya per hasil	2.782	1.348
Total Biaya	$0.306	$0.149
Harga input	$3.000 / 1M	$0.250 / 1M
Harga output	$15.000 / 1M	$2.000 / 1M
Token output	9,450	6,723
Token penalaran	0	63,082
Waktu respons (rata-rata)	5.27s	23.75s
Waktu respons (maks)	23.84s	88.15s
Waktu respons (total)	68.50s	475.03s

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Trik anti-AI	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Claude Sonnet 4.6	4.8	10.0	25.0%	0		2.94s	1,214	0
GPT-5 Mini	7.1	7.6	66.7%	1		13.86s	1,715	6,378

Pemrograman	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Claude Sonnet 4.6	6.8	10.0	50.0%	0		6.73s	2,112	0
GPT-5 Mini	10.0	10.0	100.0%	0		30.74s	580	12,544

Gabungan	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Claude Sonnet 4.6	9.5	10.0	100.0%	0		23.84s	3,766	0
GPT-5 Mini	10.0	10.0	100.0%	0		88.15s	754	11,520

Parsing dan ekstraksi data	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Claude Sonnet 4.6	10.0	10.0	100.0%	0		3.43s	252	0
GPT-5 Mini	10.0	10.0	100.0%	0		12.58s	453	3,200

Spesifik domain	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Claude Sonnet 4.6	7.7	10.0	66.7%	0		3.54s	413	0
GPT-5 Mini	3.6	7.2	22.2%	1		44.63s	293	14,016

Kecerdasan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Claude Sonnet 4.6	6.1	3.1	66.7%	1		2.56s	192	0
GPT-5 Mini	4.5	10.0	0.0%	0		13.50s	349	1,856

Kepatuhan instruksi	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Claude Sonnet 4.6	6.5	10.0	50.0%	0		1.96s	90	0
GPT-5 Mini	10.0	10.0	100.0%	0		11.59s	310	3,968

Pemecahan teka-teki	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Claude Sonnet 4.6	7.7	10.0	66.7%	0		2.53s	533	0
GPT-5 Mini	5.6	9.8	33.3%	0		15.20s	1,622	6,144

Pemanggilan alat	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Claude Sonnet 4.6	10.0	10.0	100.0%	0		4.11s	447	0
GPT-5 Mini	10.0	10.0	100.0%	0		18.64s	487	1,600

Pengetahuan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Claude Sonnet 4.6	3.0	10.0	0.0%	0		4.67s	431	0
GPT-5 Mini	3.0	10.0	0.0%	0		9.99s	160	1,856

Perbandingan Cepat

Ganti Pasangan Perbandingan

Claude Sonnet 4.6nonevsSeed-2.0-Minimedium Claude Sonnet 4.6nonevsMiMo-V2-Flashmedium GPT-5 MinimediumvsStep 3.7 Flashhigh Claude Sonnet 4.6nonevsGrok 4.20medium Ring-2.6-1TnonevsGPT-5 Minimedium GPT-5 MinimediumvsQwen3.6 Max Previewnone Claude Sonnet 4.6nonevsStep 3.7 Flashhigh Claude Sonnet 4.6nonevsMimo V2 Omnimedium Claude Opus 4.8nonevsGPT-5 Minimedium Claude Sonnet 4.6nonevsDeepSeek V3.2medium Claude Sonnet 4.6nonevsGPT-5.4 Nanomedium Claude Sonnet 4.6nonevsRing-2.6-1Tmedium