Skor rata-rata hampir imbang di 7.8 vs 7.8. Qwen3.8 27B (medium) memiliki biaya benchmark lebih rendah di ~$0.058 vs $2.089. Claude Opus 4.8 (low) lebih cepat di 12.88s vs 33.05s, dengan tingkat keberhasilan 80.3% vs 66.7%.
Benchmark dihasilkan dari suite pengujian AI BENCHY pada:
2026-09-28
Model yang Dibandingkan
Peringkat
#103
Total token output
52,237
Waktu respons (rata-rata)
12.88s
Total Biaya
$2.089
Jawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
Peringkat
#101
Total token output
136,162
Waktu respons (rata-rata)
33.05s
Total Biaya
~$0.058Perkiraan hanya mencakup listrik GPU. Komponen komputer lain dan biaya kepemilikan perangkat keras tidak termasuk. NVIDIA GeForce RTX 3090: 0.5784 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.057183.
Model yang direkomendasikanQwen3.8 27B (medium)
It has the best score here (7.8), while costing about 36.5x less than Claude Opus 4.8 (low).
Qwen3.8 27BQwen3.8 27BmediumJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.Rilis: 2026-08-14
Skor
7.8Skor rata-rata di semua tes benchmark.…
7.8Skor rata-rata di semua tes benchmark.…
Peringkat
#103
#101
Keandalan
10.0Skor sukses percobaan pertama: 10.0 berarti tidak ada kegagalan API target atau batas laju yang dapat dicoba ulang sebelum panggilan berhasil; kegagalan yang tercatat menurunkan skor.…
9.6Skor sukses percobaan pertama: 10.0 berarti tidak ada kegagalan API target atau batas laju yang dapat dicoba ulang sebelum panggilan berhasil; kegagalan yang tercatat menurunkan skor.…
Konsistensi
8.9Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
9.7Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
Percobaan
66/66
66/66
Tes benar
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 4Format tambahan: 1Tidak ada jawaban: 1Waktu respons (rata-rata)12.88sWaktu respons (maks)127.97sWaktu respons (total)283.32sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
80.3%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
66.7%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
Tes tidak stabil
3Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Total Run
66Total Run…
66Total Run…
Biaya per hasil
13.054
~0.409Perkiraan hanya mencakup listrik GPU. Komponen komputer lain dan biaya kepemilikan perangkat keras tidak termasuk. NVIDIA GeForce RTX 3090: 0.5784 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.057183.
Total Biaya
$2.089
~$0.058Perkiraan hanya mencakup listrik GPU. Komponen komputer lain dan biaya kepemilikan perangkat keras tidak termasuk. NVIDIA GeForce RTX 3090: 0.5784 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.057183.
Harga input
$5.000 / 1MHarga input…
T/AHarga input…
Harga output
$25.000 / 1MHarga output…
T/AHarga output…
Total token input
156,522Total token input…
98,266Total token input…
Token output
43,056Token output…
1,861Token output…
Token penalaran
9,181Token penalaran…
134,301Token penalaran…
Waktu respons (rata-rata)
12.88sWaktu respons (rata-rata)…
33.05sWaktu respons (rata-rata)…
Waktu respons (maks)
127.97sWaktu respons (maks)…
214.63sWaktu respons (maks)…
Waktu respons (total)
283.32sWaktu respons (total)…
694.04sWaktu respons (total)…
Parameter
~5T total (~500B aktif)
27.3B
Ketersediaan
Tertutup
Bobot tersedia
Showcase generasi model
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#103 Claude Opus 4.8
low
Biaya
$0.031
Waktu
14.1s
Token
1,345 tok
#101 Qwen3.8 27B
mediumJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
Biaya
~$0.002Perkiraan hanya mencakup listrik GPU. Komponen komputer lain dan biaya kepemilikan perangkat keras tidak termasuk. NVIDIA GeForce RTX 3090: 0.0121 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.001193.
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)3.30sWaktu respons (maks)4.34sWaktu respons (total)13.18sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
3.30sWaktu respons (rata-rata)…
834Total token input…
793Token output…
371Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
10.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)2.93sWaktu respons (maks)5.18sWaktu respons (total)11.70sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
4.6Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
77.8%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
2Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Format tambahan: 1Jawaban salah: 1Waktu respons (rata-rata)7.58sWaktu respons (maks)12.19sWaktu respons (total)22.74sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
7.58sWaktu respons (rata-rata)…
10,590Total token input…
3,637Token output…
809Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
10.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)40.50sWaktu respons (maks)72.14sWaktu respons (total)121.51sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)36.87sWaktu respons (maks)52.90sWaktu respons (total)73.74sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
36.87sWaktu respons (rata-rata)…
119,079Total token input…
13,586Token output…
2,867Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
8.7Skor rata-rata di semua tes benchmark.…
6.9Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
83.3%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Pemanggilan alat tidak valid: 1Waktu respons (rata-rata)124.48sWaktu respons (maks)214.63sWaktu respons (total)248.96sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
5.8Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
66.7%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)2.27sWaktu respons (maks)2.50sWaktu respons (total)4.54sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
2.27sWaktu respons (rata-rata)…
10,503Total token input…
310Token output…
0Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
6.5Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
50.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)8.76sWaktu respons (maks)10.36sWaktu respons (total)17.53sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
33.3%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 2Waktu respons (rata-rata)46.54sWaktu respons (maks)127.97sWaktu respons (total)139.63sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
46.54sWaktu respons (rata-rata)…
972Total token input…
23,226Token output…
4,472Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
5.3Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
33.3%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 2Waktu respons (rata-rata)76.98sWaktu respons (maks)144.07sWaktu respons (total)230.93sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)2.55sWaktu respons (maks)2.55sWaktu respons (total)2.55sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
2.55sWaktu respons (rata-rata)…
708Total token input…
231Token output…
0Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
5.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Waktu respons (rata-rata)9.20sWaktu respons (maks)9.20sWaktu respons (total)9.20sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)2.78sWaktu respons (maks)3.78sWaktu respons (total)5.56sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
2.78sWaktu respons (rata-rata)…
909Total token input…
111Token output…
221Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
10.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)2.54sWaktu respons (maks)2.67sWaktu respons (total)5.07sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)3.01sWaktu respons (maks)3.31sWaktu respons (total)9.04sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
3.01sWaktu respons (rata-rata)…
894Total token input…
592Token output…
184Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
8.3Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
66.7%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Waktu respons (rata-rata)12.62sWaktu respons (maks)29.62sWaktu respons (total)37.85sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)6.85sWaktu respons (maks)6.85sWaktu respons (total)6.85sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
6.85sWaktu respons (rata-rata)…
11,775Total token input…
370Token output…
35Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
3.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Kesalahan API: 1Waktu respons (rata-rata)0msWaktu respons (maks)0msWaktu respons (total)0msTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban: 1Waktu respons (rata-rata)5.48sWaktu respons (maks)5.48sWaktu respons (total)5.48sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
5.48sWaktu respons (rata-rata)…
258Total token input…
200Token output…
222Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
3.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban: 1Waktu respons (rata-rata)11.29sWaktu respons (maks)11.29sWaktu respons (total)11.29sTes dianggap lulus penuh hanya jika semua run-nya lulus.…