Skor rata-rata hampir imbang di 8.4 vs 8.4. Biaya perangkat keras lokal tidak diukur, sehingga perbandingan biaya tidak tersedia. Inkling Small (high) lebih cepat di 30.43s vs 167.89s, dengan tingkat keberhasilan 77.3% vs 69.7%.
Benchmark dihasilkan dari suite pengujian AI BENCHY pada:
2026-08-15
Peringkat
#42
Total token output
656,635
Waktu respons (rata-rata)
167.89s
Total Biaya
T/A
Peringkat
#44
Total token output
298,893
Waktu respons (rata-rata)
30.43s
Total Biaya
$0.398
Model yang direkomendasikanInkling Small (high)
It has the best score here (8.4), while responding about 5.5x faster than Qwen3.8 27B (high).
Perbandingan terperinci
Metrik
Qwen3.8 27BQwen3.8 27BhighJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.Rilis: 2026-08-14
9.6Skor sukses percobaan pertama: 10.0 berarti tidak ada kegagalan API target atau batas laju yang dapat dicoba ulang sebelum panggilan berhasil; kegagalan yang tercatat menurunkan skor.…
10.0Skor sukses percobaan pertama: 10.0 berarti tidak ada kegagalan API target atau batas laju yang dapat dicoba ulang sebelum panggilan berhasil; kegagalan yang tercatat menurunkan skor.…
Konsistensi
9.2Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
9.2Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
Percobaan
66/66
66/66
Tes benar
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 2Tidak ada jawaban: 2Jawaban salah: 2Waktu respons (rata-rata)167.89sWaktu respons (maks)640.85sWaktu respons (total)3693.54sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 6Tidak mengikuti instruksi: 2Waktu respons (rata-rata)30.43sWaktu respons (maks)122.60sWaktu respons (total)669.38sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
Tingkat lulus per percobaan
77.3%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
69.7%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
Tes tidak stabil
2Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
2Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Total Run
66Total Run…
66Total Run…
Biaya per hasil
T/AMenampilkan biaya rata-rata per jawaban benchmark yang benar dalam sen (semakin rendah semakin baik).…
2.868Menampilkan biaya rata-rata per jawaban benchmark yang benar dalam sen (semakin rendah semakin baik).…
Total Biaya
T/ATotal biaya (harga saat ini)…
$0.398Total biaya (harga saat ini)…
Harga input
T/AHarga input…
$0.450 / 1MHarga input…
Harga output
T/AHarga output…
$1.200 / 1MHarga output…
Total token input
100,179Total token input…
85,669Total token input…
Token output
904Token output…
6,092Token output…
Token penalaran
655,731Token penalaran…
292,801Token penalaran…
Waktu respons (rata-rata)
167.89sWaktu respons (rata-rata)…
30.43sWaktu respons (rata-rata)…
Waktu respons (maks)
640.85sWaktu respons (maks)…
122.60sWaktu respons (maks)…
Waktu respons (total)
3693.54sWaktu respons (total)…
669.38sWaktu respons (total)…
Parameter
27.3B
276B total (12B aktif)
Ketersediaan
Bobot tersedia
Tertutup
Showcase generasi model
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#42 Qwen3.8 27B
highJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
Biaya
T/A
Waktu
270.1s
Token
18,963 tok
#44 Thinking Machines: Inkling Small
high
Biaya
$0.006
Waktu
34.7s
Token
4,735 tok
Skor
-
Biaya
-
Waktu
-
Token
-
Model teratas berdasarkan skor
Skor vs Total Biaya
Waktu respons (rata-rata)
Skor vs Waktu respons (rata-rata)
Total token output
Skor vs Total token output
Rincian Kategori
Trik anti-AI
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token input
Token output
Token penalaran
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
10.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)8.10sWaktu respons (maks)21.48sWaktu respons (total)32.40sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)6.30sWaktu respons (maks)16.98sWaktu respons (total)25.21sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
6.30sWaktu respons (rata-rata)…
702Total token input…
335Token output…
9,678Token penalaran…
Pemrograman
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token input
Token output
Token penalaran
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
8.1Skor rata-rata di semua tes benchmark.…
7.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
88.9%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Waktu respons (rata-rata)248.62sWaktu respons (maks)458.25sWaktu respons (total)745.85sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)93.23sWaktu respons (maks)122.60sWaktu respons (total)279.68sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
93.23sWaktu respons (rata-rata)…
7,374Total token input…
463Token output…
120,474Token penalaran…
Gabungan
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token input
Token output
Token penalaran
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
10.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)185.57sWaktu respons (maks)333.21sWaktu respons (total)371.15sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)40.41sWaktu respons (maks)63.47sWaktu respons (total)80.83sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
40.41sWaktu respons (rata-rata)…
61,630Total token input…
4,001Token output…
28,812Token penalaran…
Parsing dan ekstraksi data
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token input
Token output
Token penalaran
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
10.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)34.85sWaktu respons (maks)57.71sWaktu respons (total)69.71sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)3.99sWaktu respons (maks)5.95sWaktu respons (total)7.98sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
3.99sWaktu respons (rata-rata)…
7,068Total token input…
216Token output…
2,763Token penalaran…
Spesifik domain
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token input
Token output
Token penalaran
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
5.3Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
33.3%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban: 1Jawaban salah: 1Waktu respons (rata-rata)526.74sWaktu respons (maks)640.85sWaktu respons (total)1580.21sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
33.3%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 2Waktu respons (rata-rata)56.28sWaktu respons (maks)101.41sWaktu respons (total)168.83sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
56.28sWaktu respons (rata-rata)…
804Total token input…
69Token output…
84,578Token penalaran…
Kecerdasan umum
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token input
Token output
Token penalaran
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
5.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Waktu respons (rata-rata)8.45sWaktu respons (maks)8.45sWaktu respons (total)8.45sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)3.62sWaktu respons (maks)3.62sWaktu respons (total)3.62sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
3.62sWaktu respons (rata-rata)…
501Total token input…
153Token output…
1,395Token penalaran…
Kepatuhan instruksi
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token input
Token output
Token penalaran
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
9.8Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)8.24sWaktu respons (maks)10.18sWaktu respons (total)16.49sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)3.94sWaktu respons (maks)4.92sWaktu respons (total)7.88sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
3.94sWaktu respons (rata-rata)…
708Total token input…
94Token output…
2,742Token penalaran…
Pemecahan teka-teki
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token input
Token output
Token penalaran
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
7.6Skor rata-rata di semua tes benchmark.…
7.2Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
77.8%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban: 1Waktu respons (rata-rata)199.90sWaktu respons (maks)569.33sWaktu respons (total)599.69sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
4.4Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
44.5%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
2Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 2Tidak mengikuti instruksi: 1Waktu respons (rata-rata)14.39sWaktu respons (maks)25.40sWaktu respons (total)43.18sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
14.39sWaktu respons (rata-rata)…
714Total token input…
482Token output…
18,286Token penalaran…
Pemanggilan alat
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token input
Token output
Token penalaran
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
10.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)5.62sWaktu respons (maks)5.62sWaktu respons (total)5.62sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Waktu respons (rata-rata)2.91sWaktu respons (maks)2.91sWaktu respons (total)2.91sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
2.91sWaktu respons (rata-rata)…
5,949Total token input…
249Token output…
577Token penalaran…
Pengetahuan umum
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token input
Token output
Token penalaran
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
3.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)263.98sWaktu respons (maks)263.98sWaktu respons (total)263.98sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)49.27sWaktu respons (maks)49.27sWaktu respons (total)49.27sTes dianggap lulus penuh hanya jika semua run-nya lulus.…