Navigasi
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Mercury 2.5 (medium) vs LongCat 2.0 (low)

Mercury 2.5 (medium) unggul dalam skor rata-rata dengan 6.8 vs 6.7. Mercury 2.5 (medium) memiliki biaya benchmark lebih rendah di $0.022 vs $0.412. Mercury 2.5 (medium) lebih cepat di 3.19s vs 113.61s, dengan tingkat keberhasilan 65.2% vs 54.6%.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-09-08

Model yang Dibandingkan

Peringkat
#157
Total token output
120,129
Waktu respons (rata-rata)
3.19s
Total Biaya
$0.022
Peringkat
#162
Total token output
320,594
Waktu respons (rata-rata)
113.61s
Total Biaya
$0.412
Model yang direkomendasikan Mercury 2.5 (medium)

It has the best score here (6.8), while costing about 19.0x less than LongCat 2.0 (low).

Perbandingan terperinci

Metrik Mercury 2.5 Mercury 2.5 medium Rilis: 2026-09-08 LongCat 2.0 LongCat 2.0 low Rilis: 2026-07-20
Skor 6.8 6.7
Peringkat #157 #162
Keandalan 9.8 9.9
Konsistensi 8.6 8.5
Percobaan 66/66 66/66
Tes benar
Tingkat lulus per percobaan 65.2% 54.6%
Tes tidak stabil 4 4
Total Run 66 66
Biaya per hasil 0.181 4.120
Total Biaya $0.022 $0.412
Harga input $0.040 / 1M $0.300 / 1M
Harga output $0.150 / 1M $1.200 / 1M
Total token input 91,402 90,870
Token output 3,138 5,676
Token penalaran 116,991 314,918
Waktu respons (rata-rata) 3.19s 113.61s
Waktu respons (maks) 9.87s 560.39s
Waktu respons (total) 70.18s 2499.46s
Parameter ~100B 1.6T total (48B aktif)
Ketersediaan Tertutup Sumber terbuka

Showcase generasi model

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#157 Mercury 2.5

medium
Biaya
$0.001
Waktu
3.8s
Token
3,386 tok

#162 LongCat 2.0

low
Biaya
$0.024
Waktu
428.0s
Token
19,557 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
Mercury 2.5 5.0 5.1 44.5% 2 3.70s 7,807 488 21,857
LongCat 2.0 6.6 4.6 77.8% 2 479.30s 6,544 461 206,627

Perbandingan Cepat

Ganti Pasangan Perbandingan