AI BENCHY
Advertise here
#13

Grok 4.20 Beta

X AI Rilis: 2026-03-12 Diuji pada: 2026-05-06 14:15 x-ai/grok-4.20-beta::medium
(medium) (none)

Ringkasan

Grok 4.20 Beta mendapat skor 8.5 di AI BENCHY dan berada di peringkat #13. Model ini memiliki reliabilitas T/A, tingkat keberhasilan 81.5%, total biaya $0.750, dan waktu respons rata-rata 9.75s.

Model diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.

Catatan identitas

Grok 4.20 Beta adalah versi pratinjau dari xAI: Grok 4.20.

Skor

8.5

Konsistensi

9.5

Keandalan

T/A

Total biaya (harga saat ini)

$0.750 ↑ +18.9%

Diuji pada: $0.631

Total token output

93,212

Total token input

35,955

Harga input

$5.805 / 1M

Harga output

$5.805 / 1M

Tes benar

Tes Salah: 4

Tingkat lulus per percobaan: 81.5%

Tes tidak stabil

1

Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).

Waktu respons (rata-rata)

9.75s

Waktu respons (maks): 31.36s

Waktu respons (total): 175.48s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#13 Grok 4.20 Beta

medium
Biaya
$0.034
Waktu
91.0s
Token
13,523 tok

Riwayat run

Diuji pada Skor Keandalan Tes benar Total Biaya Bandingkan
2026-05-06 14:15 Uji ulang 6.0 T/A $0.750 Bandingkan
2026-05-06 14:15 Uji ulang 8.5 T/A $0.750 Run saat ini
2026-05-06 14:15 Uji ulang 8.2 T/A $0.633 Bandingkan
2026-05-06 14:15 Uji ulang 8.2 T/A $0.633 Bandingkan
2026-05-06 14:15 Suite berubah 8.2 T/A $0.633 Bandingkan
2026-04-11 01:19 Run pertama yang tercatat 8.0 T/A $0.633 Bandingkan

Perbandingan run

RunSkorKonsistensiKeandalanTes benarTes tidak stabilTotal token outputTotal token inputTotal BiayaWaktu respons (rata-rata)
2026-05-06 14:15 · Uji ulang8.59.5T/A14/18193,21235,955$0.7509.75s
2026-05-06 14:15 · Uji ulang8.29.1T/A13/18293,4770$0.6339.81s
Selisih+0.3+0.4+1-1-265+35955+$0.118-63ms

Riwayat harga

Data harga historis untuk model ini dari OpenRouter.

Tanggal Harga input Harga output
2026-06-04 14:42 $5.805 / 1M $5.805 / 1M

Grafik

Pilih model pertama, lalu klik model kedua untuk membuka halaman berdampingan.

Total token output

Skor vs Total token output

Rincian Kategori

Kategori Skor Konsistensi Tes benar
Trik anti-AI 8.7 7.9
Pemrograman 10.0 10.0
Gabungan 10.0 10.0
Parsing dan ekstraksi data 10.0 10.0
Spesifik domain 5.3 10.0
Kecerdasan umum 10.0 10.0
Kepatuhan instruksi 9.8 10.0
Pemecahan teka-teki 10.0 10.0
Pemanggilan alat 3.0 10.0

Model yang Dibandingkan