Navigasi
AI BENCHY
Advertise here

Model yang Dibandingkan

Perbandingan benchmark GPT-5.4 (medium) vs GPT-5.3-Codex (medium) vs GPT-5.2 (medium): GPT-5.3-Codex (medium) unggul pada Skor dengan 8.9. GPT-5.4 (medium) unggul pada Keandalan dengan 10.0. GPT-5.3-Codex (medium) memiliki Total Biaya terendah di $0.920. GPT-5.3-Codex (medium) paling cepat di 16.96s.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-08-07

Peringkat
#29
Total token output
88,670
Waktu respons (rata-rata)
23.10s
Total Biaya
$1.533
Peringkat
#18
Total token output
55,525
Waktu respons (rata-rata)
16.96s
Total Biaya
$0.920
Peringkat
#33
Total token output
54,782
Waktu respons (rata-rata)
22.62s
Total Biaya
$0.951
Model yang direkomendasikan GPT-5.3-Codex (medium)

It has the strongest score in this comparison (8.9) and the best overall balance of cost and response time across all 3 models.

Perbandingan terperinci

Metrik GPT-5.4 GPT-5.4 medium Rilis: 2026-03-05 GPT-5.3-Codex GPT-5.3-Codex medium Rilis: 2026-02-05 GPT-5.2 GPT-5.2 medium Rilis: 2025-12-11
Skor 8.5 8.9 8.4
Peringkat #29 #18 #33
Keandalan 10.0 10.0 10.0
Konsistensi 8.6 8.6 8.5
Cakupan benchmark 22/22 tes · 66/66 percobaan 22/22 tes · 66/66 percobaan 22/22 tes · 66/66 percobaan
Tes benar
Tingkat lulus per percobaan 77.3% 83.3% 72.7%
Tes tidak stabil 4 4 4
Total Run 66 66 66
Biaya per hasil 10.220 5.748 6.791
Total Biaya $1.533 $0.920 $0.951
Harga input $2.500 / 1M $1.750 / 1M $1.750 / 1M
Harga output $15.000 / 1M $14.000 / 1M $14.000 / 1M
Total token input 81,127 81,268 105,004
Token output 6,155 6,251 9,914
Token penalaran 82,515 49,274 44,868
Waktu respons (rata-rata) 23.10s 16.96s 22.62s
Waktu respons (maks) 100.41s 100.93s 102.93s
Waktu respons (total) 508.26s 373.19s 339.28s

Showcase generasi model

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#29 GPT-5.4

medium
Biaya
$0.214
Waktu
199.6s
Token
14,349 tok

#18 GPT-5.3-Codex

medium
Biaya
$0.049
Waktu
54.9s
Token
3,580 tok

#33 GPT-5.2

medium
Biaya
$0.047
Waktu
49.2s
Token
3,396 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
GPT-5.4 8.8 7.8 88.9% 1 44.36s 7,305 433 24,216
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
GPT-5.2 10.0 10.0 100.0% 0 22.73s 7,302 511 11,912

Perbandingan Cepat

Ganti Pasangan Perbandingan