Perbandingan benchmark Grok 4.20 Beta (medium) vs Grok 4.20 Multi Agent Beta (medium) vs Grok 4.1 Fast (medium) vs Gemini 3 Flash Preview (medium):Gemini 3 Flash Preview (medium) unggul pada Skor dengan 9.6. Grok 4.1 Fast (medium) unggul pada Keandalan dengan 10.0. Grok 4.1 Fast (medium) memiliki Total Biaya terendah di $0.069. Grok 4.20 Multi Agent Beta (medium) paling cepat di 9.69s.
Benchmark dihasilkan dari suite pengujian AI BENCHY pada:
2026-07-28
Peringkat
#147
Total token output
93,212
Waktu respons (rata-rata)
9.75s
Total Biaya
$0.750
Peringkat
#203
Total token output
600,042
Waktu respons (rata-rata)
9.69s
Total Biaya
$5.599
Peringkat
#207
Total token output
98,340
Waktu respons (rata-rata)
23.85s
Total Biaya
$0.069
Peringkat
#3
Total token output
232,650
Waktu respons (rata-rata)
19.20s
Total Biaya
$0.742
Model yang direkomendasikanGemini 3 Flash Preview (medium)
It has the best score here (9.6), while costing about 2.9x less than model lain dalam perbandingan ini.
Perbandingan terperinci
Metrik
Grok 4.20 BetaGrok 4.20 BetamediumModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.Rilis: 2026-03-12
T/ASkor sukses percobaan pertama: 10.0 berarti tidak ada kegagalan API target atau batas laju yang dapat dicoba ulang sebelum panggilan berhasil; kegagalan yang tercatat menurunkan skor.…
T/ASkor sukses percobaan pertama: 10.0 berarti tidak ada kegagalan API target atau batas laju yang dapat dicoba ulang sebelum panggilan berhasil; kegagalan yang tercatat menurunkan skor.…
10.0Skor sukses percobaan pertama: 10.0 berarti tidak ada kegagalan API target atau batas laju yang dapat dicoba ulang sebelum panggilan berhasil; kegagalan yang tercatat menurunkan skor.…
10.0Skor sukses percobaan pertama: 10.0 berarti tidak ada kegagalan API target atau batas laju yang dapat dicoba ulang sebelum panggilan berhasil; kegagalan yang tercatat menurunkan skor.…
Konsistensi
7.8Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
6.4Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
6.3Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
9.7Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
Tes benar
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 3Tidak mengikuti instruksi: 1Waktu respons (rata-rata)9.75sWaktu respons (maks)31.36sWaktu respons (total)175.48sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)19.20sWaktu respons (maks)117.26sWaktu respons (total)422.42sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
Tingkat lulus per percobaan
66.7%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
48.5%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
53.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
98.5%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
Tes tidak stabil
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
5Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
6Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Total Run
52Total Run…
52Total Run…
57Total Run…
66Total Run…
Biaya per hasil
4.505Menampilkan biaya rata-rata per jawaban benchmark yang benar dalam sen (semakin rendah semakin baik).…
62.923Menampilkan biaya rata-rata per jawaban benchmark yang benar dalam sen (semakin rendah semakin baik).…
0.642Menampilkan biaya rata-rata per jawaban benchmark yang benar dalam sen (semakin rendah semakin baik).…
3.533Menampilkan biaya rata-rata per jawaban benchmark yang benar dalam sen (semakin rendah semakin baik).…
Total Biaya
$0.750Total biaya (harga saat ini)…
$5.599Total biaya (harga saat ini)…
$0.069Total biaya (harga saat ini)…
$0.742Total biaya (harga saat ini)…
Harga input
$5.805 / 1MHarga input…
$4.235 / 1MHarga input…
$0.484 / 1MHarga input…
$0.500 / 1MHarga input…
Harga output
$5.805 / 1MHarga output…
$4.235 / 1MHarga output…
$0.484 / 1MHarga output…
$3.000 / 1MHarga output…
Total token input
35,955Total token input…
721,952Total token input…
42,845Total token input…
87,861Total token input…
Token output
1,647Token output…
294,668Token output…
2,006Token output…
5,486Token output…
Token penalaran
91,565Token penalaran…
305,374Token penalaran…
96,334Token penalaran…
227,164Token penalaran…
Waktu respons (rata-rata)
9.75sWaktu respons (rata-rata)…
9.69sWaktu respons (rata-rata)…
23.85sWaktu respons (rata-rata)…
19.20sWaktu respons (rata-rata)…
Waktu respons (maks)
31.36sWaktu respons (maks)…
35.28sWaktu respons (maks)…
121.79sWaktu respons (maks)…
117.26sWaktu respons (maks)…
Waktu respons (total)
175.48sWaktu respons (total)…
155.07sWaktu respons (total)…
286.16sWaktu respons (total)…
422.42sWaktu respons (total)…
Showcase generasi model
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#147 Grok 4.20 Beta
medium
Biaya
$0.034
Waktu
91.0s
Token
13,523 tok
#203 Grok 4.20 Multi Agent Beta
medium
Biaya
$0.261
Waktu
123.4s
Token
199,344 tok
#207 Grok 4.1 Fast
medium
Grok 4.1 Fast is deprecated. xAI recommends switching to Grok 4.3 (https://openrouter.ai/x-ai/grok-4.3)
Biaya
$0.000
Waktu
0.1s
Token
0 tok
#3 Gemini 3 Flash Preview
medium
Biaya
$0.010
Waktu
18.4s
Token
3,351 tok
Skor
-
Biaya
-
Waktu
-
Token
-
Model teratas berdasarkan skor
Skor vs Total Biaya
Waktu respons (rata-rata)
Skor vs Waktu respons (rata-rata)
Total token output
Skor vs Total token output
Rincian Kategori
Trik anti-AI
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token input
Token output
Token penalaran
Grok 4.20 BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
8.7Skor rata-rata di semua tes benchmark.…
7.9Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
91.7%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)3.16sWaktu respons (maks)3.44sWaktu respons (total)12.65sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
3.16sWaktu respons (rata-rata)…
2,010Total token input…
268Token output…
7,583Token penalaran…
Grok 4.20 Multi Agent BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
6.9Skor rata-rata di semua tes benchmark.…
5.8Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
75.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
2Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Format tambahan: 1Jawaban salah: 1Waktu respons (rata-rata)3.46sWaktu respons (maks)4.38sWaktu respons (total)13.86sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
3.46sWaktu respons (rata-rata)…
90,925Total token input…
33,706Token output…
33,077Token penalaran…
Grok 4.1 FastModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
8.7Skor rata-rata di semua tes benchmark.…
7.9Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
91.7%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)3.81sWaktu respons (maks)5.65sWaktu respons (total)7.62sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)3.88sWaktu respons (maks)5.73sWaktu respons (total)15.53sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
3.88sWaktu respons (rata-rata)…
494Total token input…
330Token output…
3,216Token penalaran…
Pemrograman
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token input
Token output
Token penalaran
Grok 4.20 BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
3.3Skor rata-rata di semua tes benchmark.…
3.3Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
33.3%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)31.36sWaktu respons (maks)31.36sWaktu respons (total)31.36sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
31.36sWaktu respons (rata-rata)…
360Total token input…
81Token output…
3,987Token penalaran…
Grok 4.20 Multi Agent BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
3.3Skor rata-rata di semua tes benchmark.…
3.3Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
33.3%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)27.11sWaktu respons (maks)27.11sWaktu respons (total)27.11sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
27.11sWaktu respons (rata-rata)…
13,212Total token input…
86Token output…
13,141Token penalaran…
Grok 4.1 FastModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
7.8Skor rata-rata di semua tes benchmark.…
4.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
11.1%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Waktu respons (rata-rata)23.58sWaktu respons (maks)23.58sWaktu respons (total)23.58sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
7.6Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
88.9%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)84.40sWaktu respons (maks)117.26sWaktu respons (total)253.21sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
84.40sWaktu respons (rata-rata)…
8,122Total token input…
462Token output…
161,084Token penalaran…
Gabungan
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token input
Token output
Token penalaran
Grok 4.20 BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
5.0Skor rata-rata di semua tes benchmark.…
5.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
50.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)20.93sWaktu respons (maks)20.93sWaktu respons (total)20.93sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
20.93sWaktu respons (rata-rata)…
12,909Total token input…
227Token output…
12,212Token penalaran…
Grok 4.20 Multi Agent BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
1.5Skor rata-rata di semua tes benchmark.…
5.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Kesalahan API: 1Waktu respons (rata-rata)0msWaktu respons (maks)0msWaktu respons (total)0msTes dianggap lulus penuh hanya jika semua run-nya lulus.…
0msWaktu respons (rata-rata)…
0Total token input…
0Token output…
0Token penalaran…
Grok 4.1 FastModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
5.0Skor rata-rata di semua tes benchmark.…
5.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
50.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)37.64sWaktu respons (maks)37.64sWaktu respons (total)37.64sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)26.75sWaktu respons (maks)31.07sWaktu respons (total)53.49sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
26.75sWaktu respons (rata-rata)…
63,717Total token input…
3,831Token output…
23,496Token penalaran…
Parsing dan ekstraksi data
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token input
Token output
Token penalaran
Grok 4.20 BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
10.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)4.01sWaktu respons (maks)4.27sWaktu respons (total)8.02sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
4.01sWaktu respons (rata-rata)…
7,761Total token input…
180Token output…
5,281Token penalaran…
Grok 4.20 Multi Agent BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
10.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)5.54sWaktu respons (maks)7.51sWaktu respons (total)11.08sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
5.54sWaktu respons (rata-rata)…
97,232Total token input…
25,306Token output…
25,051Token penalaran…
Grok 4.1 FastModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
10.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)6.63sWaktu respons (maks)6.63sWaktu respons (total)6.63sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)5.43sWaktu respons (maks)6.18sWaktu respons (total)10.86sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
5.43sWaktu respons (rata-rata)…
7,548Total token input…
279Token output…
4,893Token penalaran…
Spesifik domain
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token input
Token output
Token penalaran
Grok 4.20 BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
5.3Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
33.3%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 2Waktu respons (rata-rata)21.33sWaktu respons (maks)24.21sWaktu respons (total)64.00sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
21.33sWaktu respons (rata-rata)…
1,764Total token input…
251Token output…
40,255Token penalaran…
Grok 4.20 Multi Agent BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
2.9Skor rata-rata di semua tes benchmark.…
7.2Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
11.1%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 2Format tambahan: 1Waktu respons (rata-rata)24.67sWaktu respons (maks)35.28sWaktu respons (total)74.02sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
24.67sWaktu respons (rata-rata)…
328,253Total token input…
164,609Token output…
163,647Token penalaran…
Grok 4.1 FastModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
5.8Skor rata-rata di semua tes benchmark.…
4.4Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
66.7%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
2Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Kedaluwarsa: 1Jawaban salah: 1Waktu respons (rata-rata)121.79sWaktu respons (maks)121.79sWaktu respons (total)121.79sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)15.27sWaktu respons (maks)34.09sWaktu respons (total)45.80sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
15.27sWaktu respons (rata-rata)…
633Total token input…
12Token output…
21,684Token penalaran…
Kecerdasan umum
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token input
Token output
Token penalaran
Grok 4.20 BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
10.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)5.78sWaktu respons (maks)5.78sWaktu respons (total)5.78sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
5.78sWaktu respons (rata-rata)…
825Total token input…
72Token output…
3,440Token penalaran…
Grok 4.20 Multi Agent BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
5.8Skor rata-rata di semua tes benchmark.…
2.8Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
66.7%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Waktu respons (rata-rata)6.40sWaktu respons (maks)6.40sWaktu respons (total)6.40sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
6.40sWaktu respons (rata-rata)…
41,387Total token input…
15,848Token output…
15,746Token penalaran…
Grok 4.1 FastModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
4.2Skor rata-rata di semua tes benchmark.…
9.9Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Waktu respons (rata-rata)16.25sWaktu respons (maks)16.25sWaktu respons (total)16.25sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)5.19sWaktu respons (maks)5.19sWaktu respons (total)5.19sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
5.19sWaktu respons (rata-rata)…
486Total token input…
72Token output…
1,905Token penalaran…
Kepatuhan instruksi
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token input
Token output
Token penalaran
Grok 4.20 BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
9.8Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)4.89sWaktu respons (maks)5.89sWaktu respons (total)9.78sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
4.89sWaktu respons (rata-rata)…
1,362Total token input…
57Token output…
7,123Token penalaran…
Grok 4.20 Multi Agent BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
9.8Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)3.52sWaktu respons (maks)3.80sWaktu respons (total)7.04sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
3.52sWaktu respons (rata-rata)…
43,923Total token input…
19,752Token output…
19,617Token penalaran…
Grok 4.1 FastModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
6.5Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
50.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Waktu respons (rata-rata)4.63sWaktu respons (maks)4.63sWaktu respons (total)4.63sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)4.04sWaktu respons (maks)4.70sWaktu respons (total)8.08sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
4.04sWaktu respons (rata-rata)…
615Total token input…
72Token output…
2,709Token penalaran…
Pemecahan teka-teki
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token input
Token output
Token penalaran
Grok 4.20 BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
10.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)3.52sWaktu respons (maks)4.53sWaktu respons (total)10.57sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
3.52sWaktu respons (rata-rata)…
1,689Total token input…
328Token output…
6,300Token penalaran…
Grok 4.20 Multi Agent BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
6.7Skor rata-rata di semua tes benchmark.…
7.9Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
55.6%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Jawaban salah: 1Waktu respons (rata-rata)5.19sWaktu respons (maks)5.49sWaktu respons (total)15.57sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
5.19sWaktu respons (rata-rata)…
107,020Total token input…
35,361Token output…
35,095Token penalaran…
Grok 4.1 FastModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
5.3Skor rata-rata di semua tes benchmark.…
7.2Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
44.4%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Jawaban salah: 1Waktu respons (rata-rata)7.40sWaktu respons (maks)7.79sWaktu respons (total)14.81sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)4.05sWaktu respons (maks)5.64sWaktu respons (total)12.15sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
4.05sWaktu respons (rata-rata)…
558Total token input…
183Token output…
4,365Token penalaran…
Pemanggilan alat
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token input
Token output
Token penalaran
Grok 4.20 BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
3.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak mengikuti instruksi: 1Waktu respons (rata-rata)12.39sWaktu respons (maks)12.39sWaktu respons (total)12.39sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
12.39sWaktu respons (rata-rata)…
7,275Total token input…
183Token output…
5,384Token penalaran…
Grok 4.20 Multi Agent BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
3.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Kesalahan API: 1Waktu respons (rata-rata)0msWaktu respons (maks)0msWaktu respons (total)0msTes dianggap lulus penuh hanya jika semua run-nya lulus.…
0msWaktu respons (rata-rata)…
0Total token input…
0Token output…
0Token penalaran…
Grok 4.1 FastModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
2.8Skor rata-rata di semua tes benchmark.…
1.6Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
33.3%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
1Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban: 1Waktu respons (rata-rata)27.71sWaktu respons (maks)27.71sWaktu respons (total)27.71sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)12.60sWaktu respons (maks)12.60sWaktu respons (total)12.60sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
12.60sWaktu respons (rata-rata)…
5,532Total token input…
234Token output…
1,487Token penalaran…
Pengetahuan umum
Skor
Konsistensi
Tingkat lulus per percobaan
Tes tidak stabil
Tes benar
Waktu respons (rata-rata)
Token input
Token output
Token penalaran
Grok 4.20 BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
0.0Skor rata-rata di semua tes benchmark.…
0.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)0msWaktu respons (maks)0msWaktu respons (total)0msTes dianggap lulus penuh hanya jika semua run-nya lulus.…
0msWaktu respons (rata-rata)…
0Total token input…
0Token output…
0Token penalaran…
Grok 4.20 Multi Agent BetaModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
0.0Skor rata-rata di semua tes benchmark.…
0.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)0msWaktu respons (maks)0msWaktu respons (total)0msTes dianggap lulus penuh hanya jika semua run-nya lulus.…
0msWaktu respons (rata-rata)…
0Total token input…
0Token output…
0Token penalaran…
Grok 4.1 FastModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.
3.0Skor rata-rata di semua tes benchmark.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
0.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Jawaban salah: 1Waktu respons (rata-rata)25.52sWaktu respons (maks)25.52sWaktu respons (total)25.52sTes dianggap lulus penuh hanya jika semua run-nya lulus.…
10.0Skor konsistensi mencerminkan kestabilan antar run (10 = sangat konsisten, bahkan jika konsisten salah).…
100.0%Tingkat lulus per percobaan = percobaan lulus / total percobaan di semua run.…
0Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).…
Tes dianggap lulus penuh hanya jika semua run-nya lulus.Tidak ada jawaban gagal.Waktu respons (rata-rata)5.50sWaktu respons (maks)5.50sWaktu respons (total)5.50sTes dianggap lulus penuh hanya jika semua run-nya lulus.…