Anthropic: Claude Sonnet 4.6 vs OpenAI: GPT-5.3-Codex

GPT-5.3-Codex (medium) unggul dalam skor rata-rata dengan 8.9 vs 7.3. Claude Sonnet 4.6 memiliki biaya benchmark lebih rendah di $0.661 vs $0.920. Claude Sonnet 4.6 lebih cepat di 8.12s vs 16.96s, dengan tingkat keberhasilan 57.6% vs 83.3%.

Model yang direkomendasikanGPT-5.3-Codex (medium)It has the strongest score in this comparison (8.9) and the best overall balance of cost and response time across all 2 models.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-07-25

Metrik	Claude Sonnet 4.6 Claude Sonnet 4.6 none Rilis: 2026-02-17	GPT-5.3-Codex GPT-5.3-Codex medium Rilis: 2026-02-05

Metrik	Claude Sonnet 4.6 Claude Sonnet 4.6 none Rilis: 2026-02-17	GPT-5.3-Codex GPT-5.3-Codex medium Rilis: 2026-02-05
Skor	7.3	8.9
Peringkat	#71	#18
Keandalan	10.0	10.0
Konsistensi	9.7	8.6
Tes benar
Tingkat lulus per percobaan	57.6%	83.3%
Tes tidak stabil	1	4
Total Run	66	66
Biaya per hasil	5.502	5.748
Total Biaya	$0.661	$0.920
Harga input	$3.000 / 1M	$1.750 / 1M
Harga output	$15.000 / 1M	$14.000 / 1M
Total token input	123,264	81,268
Token output	19,362	6,251
Token penalaran	0	49,274
Waktu respons (rata-rata)	8.12s	16.96s
Waktu respons (maks)	51.18s	100.93s
Waktu respons (total)	121.78s	373.19s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#71 Claude Sonnet 4.6

none

Biaya: $0.038
Waktu: 27.3s
Token: 2,598 tok

#18 GPT-5.3-Codex

medium

Biaya: $0.049
Waktu: 54.9s
Token: 3,580 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Kategori:

Trik anti-AI	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Claude Sonnet 4.6	4.8	10.0	25.0%	0		2.94s	636	1,214	0
GPT-5.3-Codex	8.7	7.9	91.7%	1		4.16s	606	240	1,722

Pemrograman	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Claude Sonnet 4.6	5.5	10.0	33.3%	0		5.19s	8,522	2,127	0
GPT-5.3-Codex	10.0	10.0	100.0%	0		19.50s	7,302	535	10,890

Gabungan	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Claude Sonnet 4.6	9.8	10.0	100.0%	0		37.51s	91,402	13,663	0
GPT-5.3-Codex	10.0	10.0	100.0%	0		26.04s	57,988	4,258	5,816

Parsing dan ekstraksi data	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Claude Sonnet 4.6	10.0	10.0	100.0%	0		3.43s	8,574	252	0
GPT-5.3-Codex	10.0	10.0	100.0%	0		3.07s	7,140	234	728

Spesifik domain	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Claude Sonnet 4.6	7.7	10.0	66.7%	0		3.54s	759	413	0
GPT-5.3-Codex	5.9	7.2	55.6%	1		64.31s	813	64	25,308

Kecerdasan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Claude Sonnet 4.6	6.1	3.1	66.7%	1		2.56s	513	192	0
GPT-5.3-Codex	4.6	10.0	0.0%	0		4.87s	477	187	331

Kepatuhan instruksi	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Claude Sonnet 4.6	6.5	10.0	50.0%	0		1.96s	690	90	0
GPT-5.3-Codex	10.0	10.0	100.0%	0		3.04s	660	93	693

Pemecahan teka-teki	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Claude Sonnet 4.6	7.7	10.0	66.7%	0		2.53s	663	533	0
GPT-5.3-Codex	9.0	7.9	88.9%	1		5.05s	642	356	1,593

Pemanggilan alat	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Claude Sonnet 4.6	10.0	10.0	100.0%	0		4.11s	11,301	447	0
GPT-5.3-Codex	10.0	10.0	100.0%	0		6.37s	5,445	254	492

Pengetahuan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Claude Sonnet 4.6	3.0	10.0	0.0%	0		4.67s	204	431	0
GPT-5.3-Codex	2.8	1.6	33.3%	1		14.43s	195	30	1,701

Perbandingan Cepat

Ganti Pasangan Perbandingan