Qwen3.8 27B unggul dalam skor rata-rata dengan 5.5 vs 5.4. Qwen3.8 27B memiliki biaya benchmark lebih rendah di ~$0.006 vs $0.053. Qwen3.8 27B lebih cepat di 3.12s vs 58.42s, dengan tingkat keberhasilan 24.2% vs 40.9%.
Benchmark dihasilkan dari suite pengujian AI BENCHY pada:
2026-09-28
Model yang Dibandingkan
Peringkat
#282
Total token output
339,595
Waktu respons (rata-rata)
58.42s
Total Biaya
$0.053
Jawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
Peringkat
#277
Total token output
11,445
Waktu respons (rata-rata)
3.12s
Total Biaya
~$0.006Perkiraan hanya mencakup listrik GPU. Komponen komputer lain dan biaya kepemilikan perangkat keras tidak termasuk. NVIDIA GeForce RTX 3090: 0.0572 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.005659.
Model yang direkomendasikanQwen3.8 27B
It has the best score here (5.5), while costing about 9.2x less than Laguna S 2.1 (medium).
Qwen3.8 27BQwen3.8 27BnoneJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.Rilis: 2026-08-14
Skor
5.4Skor rata-rata di semua tes benchmark.…
5.5Skor rata-rata di semua tes benchmark.…
Peringkat
#282
#277
Keandalan
10.0Skor sukses percobaan pertama: 10.0 berarti tidak ada kegagalan API target atau batas laju yang dapat dicoba ulang sebelum panggilan berhasil; kegagalan yang tercatat menurunkan skor.…
10.0Skor sukses percobaan pertama: 10.0 berarti tidak ada kegagalan API target atau batas laju yang dapat dicoba ulang sebelum panggilan berhasil; kegagalan yang tercatat menurunkan skor.…
Konsistensi
8.8Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
24.2%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
40.9%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
Tes tidak stabil
3Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Total Run
66Total Run…
66Total Run…
Biaya per hasil
1.451
~0.063Perkiraan hanya mencakup listrik GPU. Komponen komputer lain dan biaya kepemilikan perangkat keras tidak termasuk. NVIDIA GeForce RTX 3090: 0.0572 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.005659.
Total Biaya
$0.053
~$0.006Perkiraan hanya mencakup listrik GPU. Komponen komputer lain dan biaya kepemilikan perangkat keras tidak termasuk. NVIDIA GeForce RTX 3090: 0.0572 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.005659.
Harga input
$0.090 / 1MHarga input…
T/AHarga input…
Harga output
$0.180 / 1MHarga output…
T/AHarga output…
Total token input
86,647Total token input…
122,463Total token input…
Token output
97,298Token output…
11,445Token output…
Token penalaran
242,297Token penalaran…
0Token penalaran…
Waktu respons (rata-rata)
58.42sWaktu respons (rata-rata)…
3.12sWaktu respons (rata-rata)…
Waktu respons (maks)
560.31sWaktu respons (maks)…
44.76sWaktu respons (maks)…
Waktu respons (total)
1285.26sWaktu respons (total)…
68.69sWaktu respons (total)…
Parameter
118B total (8B aktif)
27.3B
Ketersediaan
Bobot tersedia
Bobot tersedia
Showcase generasi model
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#282 Laguna S 2.1
medium
Biaya
$0.001
Waktu
4.0s
Token
867 tok
#277 Qwen3.8 27B
noneJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
Biaya
~$0.001Perkiraan hanya mencakup listrik GPU. Komponen komputer lain dan biaya kepemilikan perangkat keras tidak termasuk. NVIDIA GeForce RTX 3090: 0.0066 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.000657.
5.8Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
25.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
2Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 3Tidak ada jawaban: 1Waktu respons (rata-rata)51.82sWaktu respons (maks)205.67sWaktu respons (total)207.27sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
51.82sWaktu respons (rata-rata)…
672Total token input…
370Token output…
45,172Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
6.5Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
50.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 2Waktu respons (rata-rata)828msWaktu respons (maks)1.95sWaktu respons (total)3.31sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
7.2Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
44.4%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban: 1Jawaban salah: 1Waktu respons (rata-rata)158.98sWaktu respons (maks)441.13sWaktu respons (total)476.95sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
158.98sWaktu respons (rata-rata)…
7,917Total token input…
93,354Token output…
106,718Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
5.5Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
33.3%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 2Waktu respons (rata-rata)1.19sWaktu respons (maks)1.97sWaktu respons (total)3.56sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
9.1Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Pemanggilan alat tidak valid: 2Waktu respons (rata-rata)284.71sWaktu respons (maks)560.31sWaktu respons (total)569.43sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
284.71sWaktu respons (rata-rata)…
60,785Total token input…
2,413Token output…
80,089Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
3.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Pemanggilan alat tidak valid: 1Jawaban salah: 1Waktu respons (rata-rata)24.10sWaktu respons (maks)44.76sWaktu respons (total)48.21sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)2.42sWaktu respons (maks)4.25sWaktu respons (total)4.84sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
2.42sWaktu respons (rata-rata)…
7,689Total token input…
243Token output…
1,699Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
6.5Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
50.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)1.14sWaktu respons (maks)1.18sWaktu respons (total)2.27sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 3Waktu respons (rata-rata)2.68sWaktu respons (maks)7.28sWaktu respons (total)8.03sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
2.68sWaktu respons (rata-rata)…
771Total token input…
24Token output…
2,863Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
7.7Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
66.7%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)552msWaktu respons (maks)675msWaktu respons (total)1.66sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
9.8Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)739msWaktu respons (maks)739msWaktu respons (total)739msTes dianggap lulus penuh hanya jika semua run-nya lulus.…
739msWaktu respons (rata-rata)…
513Total token input…
164Token output…
0Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
4.2Skor rata-rata di semua tes benchmark.…
9.9Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)1.31sWaktu respons (maks)1.31sWaktu respons (total)1.31sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
9.9Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Jawaban salah: 1Waktu respons (rata-rata)400msWaktu respons (maks)411msWaktu respons (total)799msTes dianggap lulus penuh hanya jika semua run-nya lulus.…
400msWaktu respons (rata-rata)…
702Total token input…
57Token output…
0Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
6.3Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
50.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)582msWaktu respons (maks)633msWaktu respons (total)1.16sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 3Waktu respons (rata-rata)2.62sWaktu respons (maks)6.83sWaktu respons (total)7.86sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
2.62sWaktu respons (rata-rata)…
699Total token input…
375Token output…
2,497Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
6.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
33.3%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Jawaban salah: 1Waktu respons (rata-rata)1.25sWaktu respons (maks)1.84sWaktu respons (total)3.76sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)2.24sWaktu respons (maks)2.24sWaktu respons (total)2.24sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
2.24sWaktu respons (rata-rata)…
6,747Total token input…
270Token output…
420Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
10.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)2.75sWaktu respons (maks)2.75sWaktu respons (total)2.75sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)7.11sWaktu respons (maks)7.11sWaktu respons (total)7.11sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
7.11sWaktu respons (rata-rata)…
152Total token input…
28Token output…
2,839Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
3.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)703msWaktu respons (maks)703msWaktu respons (total)703msTes dianggap lulus penuh hanya jika semua run-nya lulus.…