AI BENCHY
Advertise here
#115

Grok 4.20 Beta

X AI Rilis: 2026-03-12 Diuji pada: 2026-05-06 14:15 x-ai/grok-4.20-beta::none
(medium) (none)

Ringkasan

Grok 4.20 Beta mendapat skor 5.5 di AI BENCHY dan berada di peringkat #115. Model ini memiliki reliabilitas T/A, tingkat keberhasilan 35.2%, total biaya $0.091, dan waktu respons rata-rata 1.19s.

Yang membuat Grok 4.20 Beta unik: Model ini terasa cepat dibandingkan model serupa.

Model diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.

Catatan identitas

Grok 4.20 Beta adalah versi pratinjau dari xAI: Grok 4.20.

Skor

5.5

Konsistensi

9.2

Keandalan

T/A

Total token output

1,591

Total token input

0

Harga input

$0.000 / 1M

Harga output

$0.000 / 1M

Tes benar

Tes Salah: 13

Tingkat lulus per percobaan: 35.2%

Tes tidak stabil

2

Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).

Waktu respons (rata-rata)

1.19s

Waktu respons (maks): 6.48s

Waktu respons (total): 21.37s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#115 Grok 4.20 Beta

none
SVG tidak valid
Biaya
$0.004
Waktu
8.5s
Token
1,672 tok

Riwayat run

Diuji pada Skor Keandalan Tes benar Total Biaya Bandingkan
2026-05-06 14:15 Uji ulang 4.4 T/A $0.087 Bandingkan
2026-05-06 14:15 Uji ulang 5.8 T/A $0.087 Bandingkan
2026-05-06 14:15 Uji ulang 5.5 T/A $0.091 Bandingkan
2026-05-06 14:15 Uji ulang 5.5 T/A $0.091 Run saat ini
2026-05-06 14:15 Suite berubah 5.5 T/A $0.091 Bandingkan
2026-04-11 01:19 Run pertama yang tercatat 5.3 T/A $0.091 Bandingkan

Perbandingan run

RunSkorKonsistensiKeandalanTes benarTes tidak stabilTotal token outputTotal token inputTotal BiayaWaktu respons (rata-rata)
2026-05-06 14:15 · Uji ulang5.59.2T/A5/1821,5910$0.0911.19s
2026-05-06 14:15 · Uji ulang5.59.2T/A5/1821,5910$0.0911.19s
Selisih0.00.00000$0.0000ms

Grafik

Pilih model pertama, lalu klik model kedua untuk membuka halaman berdampingan.

Total token output

Skor vs Total token output

Rincian Kategori

Kategori Skor Konsistensi Tes benar
Trik anti-AI 4.0 8.4
Pemrograman 5.5 10.0
Gabungan 3.0 10.0
Parsing dan ekstraksi data 10.0 10.0
Spesifik domain 3.0 10.0
Kecerdasan umum 5.0 10.0
Kepatuhan instruksi 6.3 10.0
Pemecahan teka-teki 5.9 7.2
Pemanggilan alat 10.0 10.0

Model yang Dibandingkan