Nemotron 3 Super (medium) unggul dalam skor rata-rata dengan 5.5 vs 5.4. Qwen3.8 27B memiliki biaya benchmark lebih rendah di ~$0.010 vs $0.081. Qwen3.8 27B lebih cepat di 5.05s vs 56.40s, dengan tingkat keberhasilan 42.0% vs 39.1%.
Benchmark dihasilkan dari suite pengujian AI BENCHY pada:
2026-10-01
Model yang Dibandingkan
Peringkat
#264
Total token output
147,935
Waktu respons (rata-rata)
56.40s
Total Biaya
$0.081
Jawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
Peringkat
#272
Total token output
13,791
Waktu respons (rata-rata)
5.05s
Total Biaya
~$0.010Perkiraan hanya mencakup listrik GPU. Komponen komputer lain dan biaya kepemilikan perangkat keras tidak termasuk. NVIDIA GeForce RTX 3090: 0.0968 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.009566.
Model yang direkomendasikanQwen3.8 27B
Its score stays close to the best score here (5.4 vs 5.5), while costing about 8.4x less than Nemotron 3 Super (medium).
Qwen3.8 27BQwen3.8 27BnoneJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.Rilis: 2026-08-14Tersedia gratis
Qwen3.8 27BQwen3.8 27BnoneJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.Rilis: 2026-08-14Tersedia gratis
Skor
5.5Skor rata-rata di semua tes benchmark.…
5.4Skor rata-rata di semua tes benchmark.…
Peringkat
#264
#272
Keandalan
9.5Skor sukses percobaan pertama: 10.0 berarti tidak ada kegagalan API target atau batas laju yang dapat dicoba ulang sebelum panggilan berhasil; kegagalan yang tercatat menurunkan skor.…
10.0Skor sukses percobaan pertama: 10.0 berarti tidak ada kegagalan API target atau batas laju yang dapat dicoba ulang sebelum panggilan berhasil; kegagalan yang tercatat menurunkan skor.…
Konsistensi
8.5Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
42.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
39.1%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
Tes tidak stabil
4Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Total Run
69Total Run…
69Total Run…
Biaya per hasil
0.004
~0.107Perkiraan hanya mencakup listrik GPU. Komponen komputer lain dan biaya kepemilikan perangkat keras tidak termasuk. NVIDIA GeForce RTX 3090: 0.0968 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.009566.
Total Biaya
$0.081
~$0.010Perkiraan hanya mencakup listrik GPU. Komponen komputer lain dan biaya kepemilikan perangkat keras tidak termasuk. NVIDIA GeForce RTX 3090: 0.0968 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.009566.
Harga input
$0.080 / 1MHarga input…
T/AHarga input…
Harga output
$0.450 / 1MHarga output…
T/AHarga output…
Total token input
229,346Total token input…
281,460Total token input…
Token output
18,597Token output…
13,791Token output…
Token penalaran
129,338Token penalaran…
0Token penalaran…
Waktu respons (rata-rata)
56.40sWaktu respons (rata-rata)…
5.05sWaktu respons (rata-rata)…
Waktu respons (maks)
431.98sWaktu respons (maks)…
47.42sWaktu respons (maks)…
Waktu respons (total)
1184.46sWaktu respons (total)…
116.11sWaktu respons (total)…
Parameter
120B total (12B aktif)
27.3B
Ketersediaan
Bobot tersedia
Bobot tersedia
Showcase generasi model
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#264 Nemotron 3 Super
medium
Biaya
$0.000
Waktu
272.6s
Token
5,296 tok
#272 Qwen3.8 27B
noneJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
Biaya
~$0.001Perkiraan hanya mencakup listrik GPU. Komponen komputer lain dan biaya kepemilikan perangkat keras tidak termasuk. NVIDIA GeForce RTX 3090: 0.0066 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.000657.
1.6Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
66.7%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)138.25sWaktu respons (maks)138.25sWaktu respons (total)138.25sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
138.25sWaktu respons (rata-rata)…
147,908Total token input…
923Token output…
31,438Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
5.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)47.42sWaktu respons (maks)47.42sWaktu respons (total)47.42sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
75.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban: 1Waktu respons (rata-rata)7.85sWaktu respons (maks)22.30sWaktu respons (total)31.40sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
7.85sWaktu respons (rata-rata)…
686Total token input…
748Token output…
1,305Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
6.5Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
50.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 2Waktu respons (rata-rata)828msWaktu respons (maks)1.95sWaktu respons (total)3.31sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Kesalahan API: 3Waktu respons (rata-rata)147.32sWaktu respons (maks)232.25sWaktu respons (total)294.64sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
147.32sWaktu respons (rata-rata)…
2,275Total token input…
797Token output…
4,424Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
5.5Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
33.3%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 2Waktu respons (rata-rata)1.19sWaktu respons (maks)1.97sWaktu respons (total)3.56sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
5.8Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
66.7%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Kesalahan API: 1Waktu respons (rata-rata)259.89sWaktu respons (maks)431.98sWaktu respons (total)519.77sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
259.89sWaktu respons (rata-rata)…
59,463Total token input…
5,542Token output…
75,095Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
3.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Pemanggilan alat tidak valid: 1Jawaban salah: 1Waktu respons (rata-rata)24.10sWaktu respons (maks)44.76sWaktu respons (total)48.21sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)18.16sWaktu respons (maks)20.65sWaktu respons (total)36.33sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
18.16sWaktu respons (rata-rata)…
7,944Total token input…
877Token output…
2,607Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
6.5Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
50.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)1.14sWaktu respons (maks)1.18sWaktu respons (total)2.27sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
4.4Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
22.2%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
2Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 2Kedaluwarsa: 1Waktu respons (rata-rata)19.35sWaktu respons (maks)21.56sWaktu respons (total)38.71sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
19.35sWaktu respons (rata-rata)…
465Total token input…
4,558Token output…
5,119Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
7.7Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
66.7%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)552msWaktu respons (maks)675msWaktu respons (total)1.66sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Waktu respons (rata-rata)6.91sWaktu respons (maks)6.91sWaktu respons (total)6.91sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
6.91sWaktu respons (rata-rata)…
492Total token input…
105Token output…
363Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
4.2Skor rata-rata di semua tes benchmark.…
9.9Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)1.31sWaktu respons (maks)1.31sWaktu respons (total)1.31sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
50.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Waktu respons (rata-rata)6.97sWaktu respons (maks)11.23sWaktu respons (total)13.95sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
6.97sWaktu respons (rata-rata)…
723Total token input…
956Token output…
2,383Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
6.3Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
50.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)582msWaktu respons (maks)633msWaktu respons (total)1.16sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 2Tidak mengikuti instruksi: 1Waktu respons (rata-rata)3.15sWaktu respons (maks)4.52sWaktu respons (total)9.45sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
3.15sWaktu respons (rata-rata)…
708Total token input…
570Token output…
1,322Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
6.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
33.3%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Jawaban salah: 1Waktu respons (rata-rata)1.25sWaktu respons (maks)1.84sWaktu respons (total)3.76sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)39.75sWaktu respons (maks)39.75sWaktu respons (total)39.75sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
39.75sWaktu respons (rata-rata)…
8,544Total token input…
270Token output…
1,969Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
10.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)2.75sWaktu respons (maks)2.75sWaktu respons (total)2.75sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)55.32sWaktu respons (maks)55.32sWaktu respons (total)55.32sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
55.32sWaktu respons (rata-rata)…
138Total token input…
3,251Token output…
3,313Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
3.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)703msWaktu respons (maks)703msWaktu respons (total)703msTes dianggap lulus penuh hanya jika semua run-nya lulus.…