Navigasi
AI BENCHY
Advertise here

Mercury 2 (medium) vs GPT-5.3 Chat

GPT-5.3 Chat unggul dalam skor rata-rata dengan 7.5 vs 7.0. Mercury 2 (medium) memiliki biaya benchmark lebih rendah di $0.093 vs $0.571. Mercury 2 (medium) lebih cepat di 2.72s vs 6.88s, dengan tingkat keberhasilan 51.5% vs 68.2%.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-07-25

Peringkat
#86
Total token output
87,119
Waktu respons (rata-rata)
2.72s
Total Biaya
$0.093
Peringkat
#62
Total token output
30,854
Waktu respons (rata-rata)
6.88s
Total Biaya
$0.571
Model yang direkomendasikan Mercury 2 (medium)

Its score stays close to the best score here (7.0 vs 7.5), while costing about 6.1x less than GPT-5.3 Chat.

Perbandingan terperinci

Metrik Mercury 2 Mercury 2 medium Rilis: 2026-02-24 GPT-5.3 Chat GPT-5.3 Chat none Rilis: 2026-03-03
Skor 7.0 7.5
Peringkat #86 #62
Keandalan 10.0 10.0
Konsistensi 8.8 8.2
Tes benar
Tingkat lulus per percobaan 51.5% 68.2%
Tes tidak stabil 3 5
Total Run 66 66
Biaya per hasil 0.928 4.387
Total Biaya $0.093 $0.571
Harga input $0.250 / 1M $1.750 / 1M
Harga output $0.750 / 1M $14.000 / 1M
Total token input 109,572 78,990
Token output 10,313 30,854
Token penalaran 76,806 0
Waktu respons (rata-rata) 2.72s 6.88s
Waktu respons (maks) 14.63s 18.33s
Waktu respons (total) 57.12s 151.31s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#86 Mercury 2

medium
Biaya
$0.002
Waktu
2.1s
Token
1,702 tok

#62 GPT-5.3 Chat

none
Biaya
$0.008
Waktu
8.1s
Token
634 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
GPT-5.3 Chat 5.6 4.7 55.6% 2 10.52s 7,302 6,632 0

Perbandingan Cepat

Ganti Pasangan Perbandingan