Navigasi
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Mercury 2.5 vs gpt-oss-120b

Mercury 2.5 unggul dalam skor rata-rata dengan 3.9 vs 3.7. gpt-oss-120b memiliki biaya benchmark lebih rendah di $0.010 vs $0.016. Mercury 2.5 lebih cepat di 2.45s vs 21.61s, dengan tingkat keberhasilan 25.8% vs 33.3%.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-09-08

Model yang Dibandingkan

Peringkat
#312
Total token output
71,143
Waktu respons (rata-rata)
2.45s
Total Biaya
$0.016
Peringkat
#319
Total token output
51,664
Waktu respons (rata-rata)
21.61s
Total Biaya
$0.010
Model yang direkomendasikan Mercury 2.5

It has the best score here (3.9), while responding about 8.8x faster than gpt-oss-120b.

Perbandingan terperinci

Metrik Mercury 2.5 Mercury 2.5 none Rilis: 2026-09-08 gpt-oss-120b gpt-oss-120b none Rilis: 2025-08-05 Tersedia gratis
Skor 3.9 3.7
Peringkat #312 #319
Keandalan 10.0 10.0
Konsistensi 7.5 7.8
Percobaan 66/66 57/66
Tes benar
Tingkat lulus per percobaan 25.8% 33.3%
Tes tidak stabil 7 2
Total Run 66 57
Biaya per hasil 0.782 0.168
Total Biaya $0.016 $0.010
Harga input $0.040 / 1M $0.037 / 1M
Harga output $0.150 / 1M $0.170 / 1M
Total token input 123,740 9,081
Token output 71,143 51,664
Token penalaran 0 0
Waktu respons (rata-rata) 2.45s 21.61s
Waktu respons (maks) 36.48s 113.71s
Waktu respons (total) 53.83s 345.79s
Parameter ~100B 117B total (5.1B aktif)
Ketersediaan Tertutup Sumber terbuka

Showcase generasi model

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#312 Mercury 2.5

none
Biaya
$0.001
Waktu
2.7s
Token
2,749 tok

#319 gpt-oss-120b

none
Belum ada hasil showcase yang dihasilkan untuk model ini.
Biaya
T/A
Waktu
-
Token
0 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
Mercury 2.5 3.7 7.0 22.2% 1 12.50s 7,888 61,297 0
gpt-oss-120b 1.5 4.0 22.2% 1 9.57s 901 3,232 0

Perbandingan Cepat

Ganti Pasangan Perbandingan