Navigasi
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Mercury 2 (medium) vs GPT-5.6 Terra

Mercury 2 (medium) unggul dalam skor rata-rata dengan 6.6 vs 5.8. Mercury 2 (medium) memiliki biaya benchmark lebih rendah di $0.121 vs $0.377. GPT-5.6 Terra lebih cepat di 4.11s vs 4.40s, dengan tingkat keberhasilan 53.6% vs 40.6%.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-10-07

Model yang Dibandingkan

Peringkat
#201
Total token output
96,943
Waktu respons (rata-rata)
4.40s
Total Biaya
$0.121
Peringkat
#265
Total token output
7,381
Waktu respons (rata-rata)
4.11s
Total Biaya
$0.377
Model yang direkomendasikan Mercury 2 (medium)

It has the best score here (6.6), while costing about 3.1x less than GPT-5.6 Terra.

Perbandingan terperinci

Metrik Mercury 2 Mercury 2 medium Rilis: 2026-02-24 GPT-5.6 Terra GPT-5.6 Terra none Rilis: 2026-07-09
Skor 6.6 5.8
Peringkat #201 #265
Keandalan 10.0 10.0
Konsistensi 8.1 9.0
Percobaan 69/69 69/69
Tes benar
Tingkat lulus per percobaan 53.6% 40.6%
Tes tidak stabil 5 3
Total Run 69 69
Biaya per hasil 1.201 7.313
Total Biaya $0.121 $0.377
Harga input $0.250 / 1M $2.000 / 1M
Harga output $0.750 / 1M $12.000 / 1M
Harga baca cache $0.025 / 1M $0.200 / 1M
Harga tulis cache T/A $2.500 / 1M
Total token input 189,300 213,564
Token output 10,854 7,381
Token penalaran 86,089 0
Waktu respons (rata-rata) 4.40s 4.11s
Waktu respons (maks) 34.92s 57.98s
Waktu respons (total) 96.81s 94.52s
Parameter ~100B ~1T total (~60B aktif)
Ketersediaan Tertutup Tertutup

Harga cache berlaku untuk token input. Pembacaan memakai kembali prompt tersimpan; penulisan menyimpannya dan dapat menambah biaya. Token output menggunakan harga output.

Showcase generasi model

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#201 Mercury 2

medium
Biaya
$0.002
Waktu
2.1s
Token
1,702 tok

#265 GPT-5.6 Terra

none
Biaya
$0.030
Waktu
14.7s
Token
2,082 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
GPT-5.6 Terra 5.5 10.0 33.3% 0 1.00s 7,302 336 0

Ganti Pasangan Perbandingan