Navigasi
Advertise here

Decider V1.1 27B (default) vs Qwen3.5-9B (medium)

Qwen3.5-9B (medium) unggul dalam skor rata-rata dengan 4.0 vs 2.6. Decider V1.1 27B (default) memiliki biaya benchmark lebih rendah di $0.002 vs $0.106. Decider V1.1 27B (default) lebih cepat di 320ms vs 110.18s, dengan tingkat keberhasilan 17.4% vs 26.1%.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-10-07

Model yang Dibandingkan

Peringkat
#395
Total token output
69
Waktu respons (rata-rata)
320ms
Total Biaya
$0.002
Peringkat
#365
Total token output
447,247
Waktu respons (rata-rata)
110.18s
Total Biaya
$0.106
Model yang direkomendasikan Qwen3.5-9B (medium)

Model ini memiliki skor tertinggi dalam perbandingan ini (4.0) dan keseimbangan terbaik antara biaya dan waktu respons di antara 2 model.

Perbandingan terperinci

Metrik Decider V1.1 27B Decider V1.1 27B default Rilis: 2026-10-07 Qwen3.5-9B Qwen3.5-9B medium Rilis: 2026-03-02
Skor 2.6 4.0
Peringkat #395 #365
Keandalan 10.0 8.7
Konsistensi 5.2 7.9
Percobaan 36/69 69/69
Tes benar
Tingkat lulus per percobaan 17.4% 26.1%
Tes tidak stabil 0 6
Total Run 36 69
Biaya per hasil 0.037 3.523
Total Biaya $0.002 $0.106
Harga input $0.020 / 1M $0.100 / 1M
Harga output $0.000 / 1M $0.150 / 1M
Harga baca cache T/A T/A
Harga tulis cache T/A T/A
Total token input 73,557 387,323
Token output 69 48,562
Token penalaran 0 410,431
Waktu respons (rata-rata) 320ms 110.18s
Waktu respons (maks) 491ms 569.97s
Waktu respons (total) 3.84s 1873.00s
Parameter 27B 9B
Ketersediaan Sumber terbuka Sumber terbuka

Harga cache berlaku untuk token input. Pembacaan memakai kembali prompt tersimpan; penulisan menyimpannya dan dapat menambah biaya. Token output menggunakan harga output.

Showcase generasi model

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#395 Decider V1.1 27B

default
Belum ada hasil showcase yang dihasilkan untuk model ini.
Biaya
T/A
Waktu
-
Token
0 tok

#365 Qwen3.5-9B

medium
Biaya
$0.001
Waktu
35.9s
Token
3,030 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
Decider V1.1 27B 4.9 6.7 33.3% 0 305ms 32,733 12 0
Qwen3.5-9B 2.9 10.0 0.0% 0 100.88s 2,396 7,890 41,129

Ganti Pasangan Perbandingan