Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-05-26
Metrik
Grok 4.20 BetaGrok 4.20 BetamediumModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.Rilis: 2026-03-12
Grok 4.1 FastGrok 4.1 FastmediumModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.Rilis: 2025-11-19
Hunter AlphaHunter AlphamediumModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.Rilis: 2026-03-11
Metrik
Grok 4.20 BetaGrok 4.20 BetamediumModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.Rilis: 2026-03-12
Grok 4.1 FastGrok 4.1 FastmediumModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.Rilis: 2025-11-19
Hunter AlphaHunter AlphamediumModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.Rilis: 2026-03-11
Skor
8.5Skor rata-rata di semua tes benchmark.โฆ
6.5Skor rata-rata di semua tes benchmark.โฆ
6.7Skor rata-rata di semua tes benchmark.โฆ
Peringkat
#14
#88
#76
Keandalan
T/ASkor sukses percobaan pertama: 10.0 berarti tidak ada kegagalan API target atau batas laju yang dapat dicoba ulang sebelum panggilan berhasil; kegagalan yang tercatat menurunkan skor.โฆ
10.0Skor sukses percobaan pertama: 10.0 berarti tidak ada kegagalan API target atau batas laju yang dapat dicoba ulang sebelum panggilan berhasil; kegagalan yang tercatat menurunkan skor.โฆ
T/ASkor sukses percobaan pertama: 10.0 berarti tidak ada kegagalan API target atau batas laju yang dapat dicoba ulang sebelum panggilan berhasil; kegagalan yang tercatat menurunkan skor.โฆ
Konsistensi
9.5Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
7.3Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
7.4Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
Tes benar
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 3Tidak mengikuti instruksi: 1Waktu respons (rata-rata)9.75sWaktu respons (maks)31.36sWaktu respons (total)175.48sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
81.5%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
61.4%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
64.8%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
Tes tidak stabil
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
6Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
6Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Total Run
52Total Runโฆ
57Total Runโฆ
52Total Runโฆ
Biaya per hasil
4.505Menampilkan biaya rata-rata per jawaban benchmark yang benar dalam sen (semakin rendah semakin baik).โฆ
0.642Menampilkan biaya rata-rata per jawaban benchmark yang benar dalam sen (semakin rendah semakin baik).โฆ
0.000Menampilkan biaya rata-rata per jawaban benchmark yang benar dalam sen (semakin rendah semakin baik).โฆ
Total Biaya
$0.631Total Biayaโฆ
$0.058Total Biayaโฆ
$0.000Total Biayaโฆ
Harga input
$0.000 / 1MHarga inputโฆ
$0.000 / 1MHarga inputโฆ
$0.000 / 1MHarga inputโฆ
Harga output
$0.000 / 1MHarga outputโฆ
$0.000 / 1MHarga outputโฆ
$0.000 / 1MHarga outputโฆ
Token output
1,647Token outputโฆ
2,006Token outputโฆ
4,682Token outputโฆ
Token penalaran
91,565Token penalaranโฆ
96,334Token penalaranโฆ
17,969Token penalaranโฆ
Waktu respons (rata-rata)
9.75sWaktu respons (rata-rata)โฆ
23.85sWaktu respons (rata-rata)โฆ
10.33sWaktu respons (rata-rata)โฆ
Waktu respons (maks)
31.36sWaktu respons (maks)โฆ
121.79sWaktu respons (maks)โฆ
30.53sWaktu respons (maks)โฆ
Waktu respons (total)
175.48sWaktu respons (total)โฆ
286.16sWaktu respons (total)โฆ
175.58sWaktu respons (total)โฆ
Model teratas berdasarkan skor
Skor vs Total Biaya
Waktu respons (rata-rata)
Skor vs Waktu respons (rata-rata)
Total token output
Skor vs Total token output
Rincian Kategori
Trik anti-AI
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token output
Token penalaran
Grok 4.20 BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
8.7Skor rata-rata di semua tes benchmark.โฆ
7.9Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
91.7%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)3.16sWaktu respons (maks)3.44sWaktu respons (total)12.65sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
3.16sWaktu respons (rata-rata)โฆ
268Token outputโฆ
7,583Token penalaranโฆ
Grok 4.1 FastModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
8.7Skor rata-rata di semua tes benchmark.โฆ
7.9Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
91.7%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)3.81sWaktu respons (maks)5.65sWaktu respons (total)7.62sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
3.81sWaktu respons (rata-rata)โฆ
108Token outputโฆ
4,741Token penalaranโฆ
Hunter AlphaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
7.3Skor rata-rata di semua tes benchmark.โฆ
5.8Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
83.3%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
2Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 2Waktu respons (rata-rata)4.75sWaktu respons (maks)7.62sWaktu respons (total)19.00sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
4.75sWaktu respons (rata-rata)โฆ
479Token outputโฆ
1,103Token penalaranโฆ
Pemrograman
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token output
Token penalaran
Grok 4.20 BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
10.0Skor rata-rata di semua tes benchmark.โฆ
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)31.36sWaktu respons (maks)31.36sWaktu respons (total)31.36sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
31.36sWaktu respons (rata-rata)โฆ
81Token outputโฆ
3,987Token penalaranโฆ
Grok 4.1 FastModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
2.3Skor rata-rata di semua tes benchmark.โฆ
1.1Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
33.3%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Waktu respons (rata-rata)23.58sWaktu respons (maks)23.58sWaktu respons (total)23.58sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
23.58sWaktu respons (rata-rata)โฆ
821Token outputโฆ
6,703Token penalaranโฆ
Hunter AlphaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
3.0Skor rata-rata di semua tes benchmark.โฆ
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Kesalahan API: 1Waktu respons (rata-rata)0msWaktu respons (maks)0msWaktu respons (total)0msTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
0msWaktu respons (rata-rata)โฆ
0Token outputโฆ
0Token penalaranโฆ
Gabungan
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token output
Token penalaran
Grok 4.20 BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
10.0Skor rata-rata di semua tes benchmark.โฆ
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)20.93sWaktu respons (maks)20.93sWaktu respons (total)20.93sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
20.93sWaktu respons (rata-rata)โฆ
227Token outputโฆ
12,212Token penalaranโฆ
Grok 4.1 FastModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
10.0Skor rata-rata di semua tes benchmark.โฆ
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)37.64sWaktu respons (maks)37.64sWaktu respons (total)37.64sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
37.64sWaktu respons (rata-rata)โฆ
261Token outputโฆ
12,272Token penalaranโฆ
Hunter AlphaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
4.7Skor rata-rata di semua tes benchmark.โฆ
1.6Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
66.7%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Kedaluwarsa: 1Waktu respons (rata-rata)30.53sWaktu respons (maks)30.53sWaktu respons (total)30.53sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
30.53sWaktu respons (rata-rata)โฆ
792Token outputโฆ
3,456Token penalaranโฆ
Parsing dan ekstraksi data
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token output
Token penalaran
Grok 4.20 BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
10.0Skor rata-rata di semua tes benchmark.โฆ
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)4.01sWaktu respons (maks)4.27sWaktu respons (total)8.02sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
4.01sWaktu respons (rata-rata)โฆ
180Token outputโฆ
5,281Token penalaranโฆ
Grok 4.1 FastModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
10.0Skor rata-rata di semua tes benchmark.โฆ
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)6.63sWaktu respons (maks)6.63sWaktu respons (total)6.63sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
6.63sWaktu respons (rata-rata)โฆ
180Token outputโฆ
5,409Token penalaranโฆ
Hunter AlphaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
10.0Skor rata-rata di semua tes benchmark.โฆ
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)23.16sWaktu respons (maks)26.55sWaktu respons (total)46.33sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
23.16sWaktu respons (rata-rata)โฆ
1,488Token outputโฆ
8,017Token penalaranโฆ
Spesifik domain
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token output
Token penalaran
Grok 4.20 BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
5.3Skor rata-rata di semua tes benchmark.โฆ
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
33.3%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 2Waktu respons (rata-rata)21.33sWaktu respons (maks)24.21sWaktu respons (total)64.00sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
21.33sWaktu respons (rata-rata)โฆ
251Token outputโฆ
40,255Token penalaranโฆ
Grok 4.1 FastModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
5.8Skor rata-rata di semua tes benchmark.โฆ
4.4Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
66.7%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
2Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Kedaluwarsa: 1Jawaban salah: 1Waktu respons (rata-rata)121.79sWaktu respons (maks)121.79sWaktu respons (total)121.79sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
121.79sWaktu respons (rata-rata)โฆ
11Token outputโฆ
37,657Token penalaranโฆ
Hunter AlphaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
3.0Skor rata-rata di semua tes benchmark.โฆ
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Format tambahan: 1Kedaluwarsa: 1Jawaban salah: 1Waktu respons (rata-rata)10.52sWaktu respons (maks)18.68sWaktu respons (total)31.56sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
10.52sWaktu respons (rata-rata)โฆ
892Token outputโฆ
2,406Token penalaranโฆ
Kecerdasan umum
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token output
Token penalaran
Grok 4.20 BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
10.0Skor rata-rata di semua tes benchmark.โฆ
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)5.78sWaktu respons (maks)5.78sWaktu respons (total)5.78sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
5.78sWaktu respons (rata-rata)โฆ
72Token outputโฆ
3,440Token penalaranโฆ
Grok 4.1 FastModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
4.2Skor rata-rata di semua tes benchmark.โฆ
9.9Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Waktu respons (rata-rata)16.25sWaktu respons (maks)16.25sWaktu respons (total)16.25sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
16.25sWaktu respons (rata-rata)โฆ
127Token outputโฆ
3,456Token penalaranโฆ
Hunter AlphaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
7.0Skor rata-rata di semua tes benchmark.โฆ
3.7Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
66.7%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Waktu respons (rata-rata)6.44sWaktu respons (maks)6.44sWaktu respons (total)6.44sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
6.44sWaktu respons (rata-rata)โฆ
116Token outputโฆ
260Token penalaranโฆ
Kepatuhan instruksi
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token output
Token penalaran
Grok 4.20 BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
9.8Skor rata-rata di semua tes benchmark.โฆ
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)4.89sWaktu respons (maks)5.89sWaktu respons (total)9.78sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
4.89sWaktu respons (rata-rata)โฆ
57Token outputโฆ
7,123Token penalaranโฆ
Grok 4.1 FastModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
6.5Skor rata-rata di semua tes benchmark.โฆ
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
50.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Waktu respons (rata-rata)4.63sWaktu respons (maks)4.63sWaktu respons (total)4.63sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
4.63sWaktu respons (rata-rata)โฆ
54Token outputโฆ
3,326Token penalaranโฆ
Hunter AlphaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
9.9Skor rata-rata di semua tes benchmark.โฆ
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)4.18sWaktu respons (maks)4.46sWaktu respons (total)8.36sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
4.18sWaktu respons (rata-rata)โฆ
208Token outputโฆ
465Token penalaranโฆ
Pemecahan teka-teki
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token output
Token penalaran
Grok 4.20 BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
10.0Skor rata-rata di semua tes benchmark.โฆ
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)3.52sWaktu respons (maks)4.53sWaktu respons (total)10.57sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
3.52sWaktu respons (rata-rata)โฆ
328Token outputโฆ
6,300Token penalaranโฆ
Grok 4.1 FastModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
5.3Skor rata-rata di semua tes benchmark.โฆ
7.2Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
44.4%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Jawaban salah: 1Waktu respons (rata-rata)7.40sWaktu respons (maks)7.79sWaktu respons (total)14.81sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
7.40sWaktu respons (rata-rata)โฆ
169Token outputโฆ
5,904Token penalaranโฆ
Hunter AlphaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
6.1Skor rata-rata di semua tes benchmark.โฆ
4.7Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
66.7%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
2Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Jawaban salah: 1Waktu respons (rata-rata)5.35sWaktu respons (maks)6.20sWaktu respons (total)16.06sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
5.35sWaktu respons (rata-rata)โฆ
399Token outputโฆ
1,358Token penalaranโฆ
Pemanggilan alat
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token output
Token penalaran
Grok 4.20 BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
3.0Skor rata-rata di semua tes benchmark.โฆ
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Waktu respons (rata-rata)12.39sWaktu respons (maks)12.39sWaktu respons (total)12.39sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
12.39sWaktu respons (rata-rata)โฆ
183Token outputโฆ
5,384Token penalaranโฆ
Grok 4.1 FastModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
2.8Skor rata-rata di semua tes benchmark.โฆ
1.6Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
33.3%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban: 1Waktu respons (rata-rata)27.71sWaktu respons (maks)27.71sWaktu respons (total)27.71sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
27.71sWaktu respons (rata-rata)โฆ
260Token outputโฆ
11,485Token penalaranโฆ
Hunter AlphaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
10.0Skor rata-rata di semua tes benchmark.โฆ
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)17.33sWaktu respons (maks)17.33sWaktu respons (total)17.33sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
17.33sWaktu respons (rata-rata)โฆ
308Token outputโฆ
904Token penalaranโฆ
Pengetahuan umum
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token output
Token penalaran
Grok 4.20 BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
-
-
-
-
-
-
-
-
Grok 4.1 FastModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
3.0Skor rata-rata di semua tes benchmark.โฆ
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).โฆ
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.โฆ
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).โฆ
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)25.52sWaktu respons (maks)25.52sWaktu respons (total)25.52sTes dianggap lulus penuh hanya jika semua run-nya lulus.โฆ
25.52sWaktu respons (rata-rata)โฆ
15Token outputโฆ
5,381Token penalaranโฆ
Hunter AlphaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.