AI BENCHY
Advertise here
#81

Grok 4.20 Multi Agent Beta

X AI Rilis: 2026-03-12 Diuji pada: 2026-05-06 14:16 x-ai/grok-4.20-multi-agent-beta::medium

Ringkasan

Grok 4.20 Multi Agent Beta mendapat skor 6.6 di AI BENCHY dan berada di peringkat #81. Model ini memiliki reliabilitas T/A, tingkat keberhasilan 63.0%, total biaya $5.074, dan waktu respons rata-rata 9.80s.

Yang membuat Grok 4.20 Multi Agent Beta unik: Model ini paling menonjol di Pemrograman, dengan peringkat #1, sementara Gabungan adalah area terlemahnya di #17. Model ini memakai token reasoning yang sangat tinggi, yang bisa menjelaskan run yang lebih lambat atau lebih mahal.

Model diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.

Skor

6.6

Konsistensi

7.4

Keandalan

T/A

Total token output

608,704

Total token input

0

Harga input

$0.000 / 1M

Harga output

$0.000 / 1M

Tes benar

Tes Salah: 10

Tingkat lulus per percobaan: 63.0%

Tes tidak stabil

6

Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).

Waktu respons (rata-rata)

9.80s

Waktu respons (maks): 35.28s

Waktu respons (total): 156.75s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#81 Grok 4.20 Multi Agent Beta

medium
Biaya
$0.261
Waktu
123.4s
Token
199,344 tok

Riwayat run

Diuji pada Skor Keandalan Tes benar Total Biaya Bandingkan
2026-05-06 14:16 Uji ulang 4.8 T/A $5.599 Bandingkan
2026-05-06 14:16 Uji ulang 6.6 T/A $5.599 Bandingkan
2026-05-06 14:16 Uji ulang 6.6 T/A $5.074 Run saat ini
2026-05-06 14:16 Suite berubah 6.6 T/A $5.074 Bandingkan
2026-04-11 01:19 Run pertama yang tercatat 6.4 T/A $5.074 Bandingkan

Perbandingan run

RunSkorKonsistensiKeandalanTes benarTes tidak stabilTotal token outputTotal token inputTotal BiayaWaktu respons (rata-rata)
2026-05-06 14:16 · Uji ulang6.67.4T/A8/186608,7040$5.0749.80s
2026-05-06 14:16 · Suite berubah6.67.4T/A8/186608,7040$5.0749.80s
Selisih0.00.00000$0.0000ms

Grafik

Pilih model pertama, lalu klik model kedua untuk membuka halaman berdampingan.

Total token output

Skor vs Total token output

Rincian Kategori

Kategori Skor Konsistensi Tes benar
Trik anti-AI 6.9 5.8
Pemrograman 10.0 10.0
Gabungan 3.0 10.0
Parsing dan ekstraksi data 10.0 10.0
Spesifik domain 2.9 7.2
Kecerdasan umum 5.8 2.8
Kepatuhan instruksi 9.8 10.0
Pemecahan teka-teki 7.2 5.1
Pemanggilan alat 3.0 10.0

Model yang Dibandingkan