Navigasi
Advertise here

Mercury 2.5 Preview (medium) vs Qwen3.5-35B-A3B (medium)

Mercury 2.5 Preview (medium) unggul dalam skor rata-rata dengan 6.8 vs 6.3. Mercury 2.5 Preview (medium) memiliki biaya benchmark lebih rendah di $0.039 vs $0.716. Mercury 2.5 Preview (medium) lebih cepat di 6.66s vs 111.54s, dengan tingkat keberhasilan 66.7% vs 65.2%.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-10-09

Model yang Dibandingkan

Peringkat
#183
Total token output
150,107
Waktu respons (rata-rata)
6.66s
Total Biaya
$0.039
Peringkat
#225
Total token output
913,343
Waktu respons (rata-rata)
111.54s
Total Biaya
$0.716
Model yang direkomendasikan Mercury 2.5 Preview (medium)

It has the best score here (6.8), while costing about 18.6x less than Qwen3.5-35B-A3B (medium).

Perbandingan terperinci

Metrik Mercury 2.5 Preview Mercury 2.5 Preview medium Rilis: 2026-09-02 Qwen3.5-35B-A3B Qwen3.5-35B-A3B medium Rilis: 2026-02-24
Skor 6.8 6.3
Peringkat #183 #225
Keandalan 10.0 10.0
Konsistensi 9.6 7.5
Percobaan 69/69 69/69
Tes benar
Tingkat lulus per percobaan 66.7% 65.2%
Tes tidak stabil 1 7
Total Run 69 69
Biaya per hasil 0.244 10.505
Total Biaya $0.039 $0.716
Harga input $0.040 / 1M $0.080 / 1M
Harga output $0.150 / 1M $0.750 / 1M
Harga baca cache T/A $0.040 / 1M
Harga tulis cache T/A T/A
Total token input 397,291 378,048
Token output 6,355 56,477
Token penalaran 143,752 865,151
Waktu respons (rata-rata) 6.66s 111.54s
Waktu respons (maks) 74.63s 950.25s
Waktu respons (total) 153.29s 2565.38s
Parameter ~100B 35B total (3B aktif)
Ketersediaan Tertutup Sumber terbuka

Harga cache berlaku untuk token input. Pembacaan memakai kembali prompt tersimpan; penulisan menyimpannya dan dapat menambah biaya. Token output menggunakan harga output.

Showcase generasi model

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#183 Mercury 2.5 Preview

medium
Biaya
$0.001
Waktu
2.7s
Token
2,241 tok

#225 Qwen3.5-35B-A3B

medium
Biaya
$0.009
Waktu
71.4s
Token
8,631 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
Mercury 2.5 Preview 7.8 10.0 66.7% 0 3.86s 7,839 552 22,126
Qwen3.5-35B-A3B 5.9 9.3 33.3% 0 206.65s 4,106 23,844 111,462

Ganti Pasangan Perbandingan