Skor rata-rata hampir imbang di 8.4 vs 8.4. Biaya perangkat keras lokal tidak diukur, sehingga perbandingan biaya tidak tersedia. Qwen3.8 27B (high) lebih cepat di 167.89s vs 193.59s, dengan tingkat keberhasilan 78.8% vs 77.3%.
Benchmark dihasilkan dari suite pengujian AI BENCHY pada:
2026-08-15
Peringkat
#43
Total token output
759,191
Waktu respons (rata-rata)
193.59s
Total Biaya
$1.951
Peringkat
#42
Total token output
656,635
Waktu respons (rata-rata)
167.89s
Total Biaya
T/A
Model yang direkomendasikanSeed 2.1 Turbo (medium)
It has the strongest score in this comparison (8.4) and the best overall balance of cost and response time across all 2 models.
Qwen3.8 27BQwen3.8 27BhighJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.Rilis: 2026-08-14
Skor
8.4Skor rata-rata di semua tes benchmark.…
8.4Skor rata-rata di semua tes benchmark.…
Peringkat
#43
#42
Keandalan
10.0Skor sukses percobaan pertama: 10.0 berarti tidak ada kegagalan API target atau batas laju yang dapat dicoba ulang sebelum panggilan berhasil; kegagalan yang tercatat menurunkan skor.…
9.6Skor sukses percobaan pertama: 10.0 berarti tidak ada kegagalan API target atau batas laju yang dapat dicoba ulang sebelum panggilan berhasil; kegagalan yang tercatat menurunkan skor.…
Konsistensi
8.2Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
9.2Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
Percobaan
66/66
66/66
Tes benar
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 5Tidak mengikuti instruksi: 1Tidak ada jawaban: 1Waktu respons (rata-rata)193.59sWaktu respons (maks)885.33sWaktu respons (total)4258.98sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 2Tidak ada jawaban: 2Jawaban salah: 2Waktu respons (rata-rata)167.89sWaktu respons (maks)640.85sWaktu respons (total)3693.54sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
Tingkat lulus per percobaan
78.8%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
77.3%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
Tes tidak stabil
5Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
2Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Total Run
66Total Run…
66Total Run…
Biaya per hasil
13.002Menampilkan biaya rata-rata per jawaban benchmark yang benar dalam sen (semakin rendah semakin baik).…
T/AMenampilkan biaya rata-rata per jawaban benchmark yang benar dalam sen (semakin rendah semakin baik).…
Total Biaya
$1.951Total biaya (harga saat ini)…
T/ATotal biaya (harga saat ini)…
Harga input
$0.500 / 1MHarga input…
T/AHarga input…
Harga output
$2.500 / 1MHarga output…
T/AHarga output…
Total token input
104,433Total token input…
100,179Total token input…
Token output
6,511Token output…
904Token output…
Token penalaran
752,680Token penalaran…
655,731Token penalaran…
Waktu respons (rata-rata)
193.59sWaktu respons (rata-rata)…
167.89sWaktu respons (rata-rata)…
Waktu respons (maks)
885.33sWaktu respons (maks)…
640.85sWaktu respons (maks)…
Waktu respons (total)
4258.98sWaktu respons (total)…
3693.54sWaktu respons (total)…
Parameter
~200B total (~20B aktif)
27.3B
Ketersediaan
Tertutup
Bobot tersedia
Showcase generasi model
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#43 Seed 2.1 Turbo
medium
Biaya
$0.099
Waktu
583.9s
Token
39,514 tok
#42 Qwen3.8 27B
highJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
7.9Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
83.3%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)28.25sWaktu respons (maks)38.70sWaktu respons (total)113.00sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
28.25sWaktu respons (rata-rata)…
906Total token input…
386Token output…
18,834Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
10.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)8.10sWaktu respons (maks)21.48sWaktu respons (total)32.40sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
7.2Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
88.9%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban: 1Waktu respons (rata-rata)354.87sWaktu respons (maks)449.66sWaktu respons (total)1064.62sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
354.87sWaktu respons (rata-rata)…
8,220Total token input…
384Token output…
205,892Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
8.1Skor rata-rata di semua tes benchmark.…
7.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
88.9%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Waktu respons (rata-rata)248.62sWaktu respons (maks)458.25sWaktu respons (total)745.85sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)400.28sWaktu respons (maks)406.56sWaktu respons (total)800.55sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
400.28sWaktu respons (rata-rata)…
74,115Total token input…
4,563Token output…
146,571Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
10.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)185.57sWaktu respons (maks)333.21sWaktu respons (total)371.15sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)37.82sWaktu respons (maks)50.79sWaktu respons (total)75.65sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
37.82sWaktu respons (rata-rata)…
8,544Total token input…
246Token output…
14,215Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
10.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)34.85sWaktu respons (maks)57.71sWaktu respons (total)69.71sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
4.4Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
22.2%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
2Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 3Waktu respons (rata-rata)656.04sWaktu respons (maks)885.33sWaktu respons (total)1968.13sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
656.04sWaktu respons (rata-rata)…
828Total token input…
13Token output…
333,977Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
5.3Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
33.3%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban: 1Jawaban salah: 1Waktu respons (rata-rata)526.74sWaktu respons (maks)640.85sWaktu respons (total)1580.21sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
3.1Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
66.7%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Waktu respons (rata-rata)40.59sWaktu respons (maks)40.59sWaktu respons (total)40.59sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
40.59sWaktu respons (rata-rata)…
573Total token input…
204Token output…
6,294Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
5.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Waktu respons (rata-rata)8.45sWaktu respons (maks)8.45sWaktu respons (total)8.45sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)7.48sWaktu respons (maks)9.84sWaktu respons (total)14.96sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
7.48sWaktu respons (rata-rata)…
816Total token input…
72Token output…
1,875Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
9.8Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)8.24sWaktu respons (maks)10.18sWaktu respons (total)16.49sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)21.01sWaktu respons (maks)31.49sWaktu respons (total)63.03sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
21.01sWaktu respons (rata-rata)…
867Total token input…
405Token output…
10,438Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
7.6Skor rata-rata di semua tes benchmark.…
7.2Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
77.8%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban: 1Waktu respons (rata-rata)199.90sWaktu respons (maks)569.33sWaktu respons (total)599.69sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)27.46sWaktu respons (maks)27.46sWaktu respons (total)27.46sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
27.46sWaktu respons (rata-rata)…
9,297Total token input…
228Token output…
1,482Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
10.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)5.62sWaktu respons (maks)5.62sWaktu respons (total)5.62sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)91.00sWaktu respons (maks)91.00sWaktu respons (total)91.00sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
91.00sWaktu respons (rata-rata)…
267Total token input…
10Token output…
13,102Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
3.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)263.98sWaktu respons (maks)263.98sWaktu respons (total)263.98sTes dianggap lulus penuh hanya jika semua run-nya lulus.…