KAT-Coder-Air V2.5 (high) unggul dalam skor rata-rata dengan 5.6 vs 5.5. Qwen3.8 27B memiliki biaya benchmark lebih rendah di ~$0.006 vs $0.077. Qwen3.8 27B lebih cepat di 3.12s vs 15.87s, dengan tingkat keberhasilan 42.4% vs 40.9%.
Benchmark dihasilkan dari suite pengujian AI BENCHY pada:
2026-09-28
Model yang Dibandingkan
Peringkat
#265
Total token output
114,654
Waktu respons (rata-rata)
15.87s
Total Biaya
$0.077
Jawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
Peringkat
#277
Total token output
11,445
Waktu respons (rata-rata)
3.12s
Total Biaya
~$0.006Perkiraan hanya mencakup listrik GPU. Komponen komputer lain dan biaya kepemilikan perangkat keras tidak termasuk. NVIDIA GeForce RTX 3090: 0.0572 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.005659.
Model yang direkomendasikanQwen3.8 27B
Its score stays close to the best score here (5.5 vs 5.6), while costing about 13.5x less than KAT-Coder-Air V2.5 (high).
Qwen3.8 27BQwen3.8 27BnoneJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.Rilis: 2026-08-14
Skor
5.6Skor rata-rata di semua tes benchmark.…
5.5Skor rata-rata di semua tes benchmark.…
Peringkat
#265
#277
Keandalan
9.8Skor sukses percobaan pertama: 10.0 berarti tidak ada kegagalan API target atau batas laju yang dapat dicoba ulang sebelum panggilan berhasil; kegagalan yang tercatat menurunkan skor.…
10.0Skor sukses percobaan pertama: 10.0 berarti tidak ada kegagalan API target atau batas laju yang dapat dicoba ulang sebelum panggilan berhasil; kegagalan yang tercatat menurunkan skor.…
Konsistensi
8.1Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
Percobaan
66/66
66/66
Tes benar
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 9Kesalahan API: 3Format tambahan: 3Waktu respons (rata-rata)15.87sWaktu respons (maks)118.35sWaktu respons (total)349.16sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
42.4%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
40.9%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
Tes tidak stabil
5Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Total Run
66Total Run…
66Total Run…
Biaya per hasil
1.091
~0.063Perkiraan hanya mencakup listrik GPU. Komponen komputer lain dan biaya kepemilikan perangkat keras tidak termasuk. NVIDIA GeForce RTX 3090: 0.0572 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.005659.
Total Biaya
$0.077
~$0.006Perkiraan hanya mencakup listrik GPU. Komponen komputer lain dan biaya kepemilikan perangkat keras tidak termasuk. NVIDIA GeForce RTX 3090: 0.0572 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.005659.
Harga input
$0.150 / 1MHarga input…
T/AHarga input…
Harga output
$0.600 / 1MHarga output…
T/AHarga output…
Total token input
50,423Total token input…
122,463Total token input…
Token output
4,144Token output…
11,445Token output…
Token penalaran
110,510Token penalaran…
0Token penalaran…
Waktu respons (rata-rata)
15.87sWaktu respons (rata-rata)…
3.12sWaktu respons (rata-rata)…
Waktu respons (maks)
118.35sWaktu respons (maks)…
44.76sWaktu respons (maks)…
Waktu respons (total)
349.16sWaktu respons (total)…
68.69sWaktu respons (total)…
Parameter
~35B total (~3B aktif)
27.3B
Ketersediaan
Tertutup
Bobot tersedia
Showcase generasi model
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#265 KAT-Coder-Air V2.5
high
Reached the allocated time limit (300 seconds) without receiving showcase output.
Biaya
$0.000
Waktu
300.0s
Token
0 tok
#277 Qwen3.8 27B
noneJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
Biaya
~$0.001Perkiraan hanya mencakup listrik GPU. Komponen komputer lain dan biaya kepemilikan perangkat keras tidak termasuk. NVIDIA GeForce RTX 3090: 0.0066 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.000657.
5.8Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
75.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
2Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Kesalahan API: 1Jawaban salah: 1Waktu respons (rata-rata)2.49sWaktu respons (maks)3.97sWaktu respons (total)9.97sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
2.49sWaktu respons (rata-rata)…
615Total token input…
204Token output…
1,290Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
6.5Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
50.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 2Waktu respons (rata-rata)828msWaktu respons (maks)1.95sWaktu respons (total)3.31sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
7.3Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
11.1%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Kesalahan API: 1Format tambahan: 1Jawaban salah: 1Waktu respons (rata-rata)39.07sWaktu respons (maks)104.98sWaktu respons (total)117.21sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
39.07sWaktu respons (rata-rata)…
6,948Total token input…
1,166Token output…
55,883Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
5.5Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
33.3%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 2Waktu respons (rata-rata)1.19sWaktu respons (maks)1.97sWaktu respons (total)3.56sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
50.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Kesalahan API: 1Waktu respons (rata-rata)74.48sWaktu respons (maks)118.35sWaktu respons (total)148.95sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
74.48sWaktu respons (rata-rata)…
23,854Total token input…
485Token output…
28,559Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
3.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Pemanggilan alat tidak valid: 1Jawaban salah: 1Waktu respons (rata-rata)24.10sWaktu respons (maks)44.76sWaktu respons (total)48.21sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
50.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)3.59sWaktu respons (maks)4.92sWaktu respons (total)7.18sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
3.59sWaktu respons (rata-rata)…
7,776Total token input…
284Token output…
2,140Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
6.5Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
50.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)1.14sWaktu respons (maks)1.18sWaktu respons (total)2.27sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Format tambahan: 2Jawaban salah: 1Waktu respons (rata-rata)7.28sWaktu respons (maks)8.71sWaktu respons (total)21.85sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
7.28sWaktu respons (rata-rata)…
724Total token input…
1,101Token output…
7,738Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
7.7Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
66.7%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)552msWaktu respons (maks)675msWaktu respons (total)1.66sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)7.10sWaktu respons (maks)7.10sWaktu respons (total)7.10sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
7.10sWaktu respons (rata-rata)…
516Total token input…
179Token output…
539Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
4.2Skor rata-rata di semua tes benchmark.…
9.9Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)1.31sWaktu respons (maks)1.31sWaktu respons (total)1.31sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)1.51sWaktu respons (maks)1.91sWaktu respons (total)3.01sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
1.51sWaktu respons (rata-rata)…
699Total token input…
90Token output…
675Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
6.3Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
50.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)582msWaktu respons (maks)633msWaktu respons (total)1.16sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
4.4Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
33.3%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
2Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 3Waktu respons (rata-rata)2.47sWaktu respons (maks)2.86sWaktu respons (total)7.40sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
2.47sWaktu respons (rata-rata)…
696Total token input…
285Token output…
1,576Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
6.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
33.3%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Jawaban salah: 1Waktu respons (rata-rata)1.25sWaktu respons (maks)1.84sWaktu respons (total)3.76sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)4.77sWaktu respons (maks)4.77sWaktu respons (total)4.77sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
4.77sWaktu respons (rata-rata)…
8,391Total token input…
330Token output…
1,082Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
10.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)2.75sWaktu respons (maks)2.75sWaktu respons (total)2.75sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)21.72sWaktu respons (maks)21.72sWaktu respons (total)21.72sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
21.72sWaktu respons (rata-rata)…
204Total token input…
20Token output…
11,028Token penalaran…
Qwen3.8 27BJawaban model kandidat dibuat di perangkat keras lokal. OpenRouter hanya digunakan untuk penilaian.
3.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)703msWaktu respons (maks)703msWaktu respons (total)703msTes dianggap lulus penuh hanya jika semua run-nya lulus.…