Navigasi
Advertise here

gpt-oss-120b vs Qwen3.5-9B (medium)

gpt-oss-120b unggul dalam skor rata-rata dengan 4.2 vs 4.0. gpt-oss-120b memiliki biaya benchmark lebih rendah di $0.016 vs $0.106. gpt-oss-120b lebih cepat di 28.63s vs 110.18s, dengan tingkat keberhasilan 34.8% vs 26.1%.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-10-07

Model yang Dibandingkan

Peringkat
#361
Total token output
62,213
Waktu respons (rata-rata)
28.63s
Total Biaya
$0.016
Peringkat
#365
Total token output
447,247
Waktu respons (rata-rata)
110.18s
Total Biaya
$0.106
Model yang direkomendasikan gpt-oss-120b

It has the best score here (4.2), while costing about 6.8x less than Qwen3.5-9B (medium).

Perbandingan terperinci

Metrik gpt-oss-120b gpt-oss-120b none Rilis: 2025-08-05 Qwen3.5-9B Qwen3.5-9B medium Rilis: 2026-03-02
Skor 4.2 4.0
Peringkat #361 #365
Keandalan 10.0 8.7
Konsistensi 7.6 7.9
Percobaan 60/69 69/69
Tes benar
Tingkat lulus per percobaan 34.8% 26.1%
Tes tidak stabil 3 6
Total Run 60 69
Biaya per hasil 0.274 3.523
Total Biaya $0.016 $0.106
Harga input $0.037 / 1M $0.100 / 1M
Harga output $0.170 / 1M $0.150 / 1M
Harga baca cache T/A T/A
Harga tulis cache T/A T/A
Total token input 131,652 387,323
Token output 16,869 48,562
Token penalaran 53,081 410,431
Waktu respons (rata-rata) 28.63s 110.18s
Waktu respons (maks) 140.90s 569.97s
Waktu respons (total) 486.69s 1873.00s
Parameter 117B total (5.1B aktif) 9B
Ketersediaan Sumber terbuka Sumber terbuka

Harga cache berlaku untuk token input. Pembacaan memakai kembali prompt tersimpan; penulisan menyimpannya dan dapat menambah biaya. Token output menggunakan harga output.

Showcase generasi model

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#361 gpt-oss-120b

none
Belum ada hasil showcase yang dihasilkan untuk model ini.
Biaya
T/A
Waktu
-
Token
0 tok

#365 Qwen3.5-9B

medium
Biaya
$0.001
Waktu
35.9s
Token
3,030 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
gpt-oss-120b 1.5 0.4 22.2% 1 9.57s 901 204 3,028
Qwen3.5-9B 2.9 10.0 0.0% 0 100.88s 2,396 7,890 41,129

Ganti Pasangan Perbandingan