Navigasi
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Model yang Dibandingkan

Perbandingan benchmark Grok 4.20 Beta (medium) vs Grok 4.20 Multi Agent Beta (medium) vs Grok 4.1 Fast (medium) vs Gemini 3 Flash Preview (medium): Gemini 3 Flash Preview (medium) unggul pada Skor dengan 9.6. Grok 4.1 Fast (medium) unggul pada Keandalan dengan 10.0. Grok 4.1 Fast (medium) memiliki Total Biaya terendah di $0.069. Grok 4.20 Multi Agent Beta (medium) paling cepat di 9.69s.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-07-28

Peringkat
#147
Total token output
93,212
Waktu respons (rata-rata)
9.75s
Total Biaya
$0.750
Peringkat
#203
Total token output
600,042
Waktu respons (rata-rata)
9.69s
Total Biaya
$5.599
Peringkat
#207
Total token output
98,340
Waktu respons (rata-rata)
23.85s
Total Biaya
$0.069
Peringkat
#3
Total token output
232,650
Waktu respons (rata-rata)
19.20s
Total Biaya
$0.742
Model yang direkomendasikan Gemini 3 Flash Preview (medium)

It has the best score here (9.6), while costing about 2.9x less than model lain dalam perbandingan ini.

Perbandingan terperinci

Metrik Grok 4.20 Beta Grok 4.20 Beta medium Rilis: 2026-03-12 Grok 4.20 Multi Agent Beta Grok 4.20 Multi Agent Beta medium Rilis: 2026-03-12 Grok 4.1 Fast Grok 4.1 Fast medium Rilis: 2025-11-19 Gemini 3 Flash Preview Gemini 3 Flash Preview medium Rilis: 2025-12-17
Skor 6.0 4.8 4.7 9.6
Peringkat #147 #203 #207 #3
Keandalan T/A T/A 10.0 10.0
Konsistensi 7.8 6.4 6.3 9.7
Tes benar
Tingkat lulus per percobaan 66.7% 48.5% 53.0% 98.5%
Tes tidak stabil 1 5 6 1
Total Run 52 52 57 66
Biaya per hasil 4.505 62.923 0.642 3.533
Total Biaya $0.750 $5.599 $0.069 $0.742
Harga input $5.805 / 1M $4.235 / 1M $0.484 / 1M $0.500 / 1M
Harga output $5.805 / 1M $4.235 / 1M $0.484 / 1M $3.000 / 1M
Total token input 35,955 721,952 42,845 87,861
Token output 1,647 294,668 2,006 5,486
Token penalaran 91,565 305,374 96,334 227,164
Waktu respons (rata-rata) 9.75s 9.69s 23.85s 19.20s
Waktu respons (maks) 31.36s 35.28s 121.79s 117.26s
Waktu respons (total) 175.48s 155.07s 286.16s 422.42s

Showcase generasi model

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#147 Grok 4.20 Beta

medium
Biaya
$0.034
Waktu
91.0s
Token
13,523 tok

#203 Grok 4.20 Multi Agent Beta

medium
Biaya
$0.261
Waktu
123.4s
Token
199,344 tok

#207 Grok 4.1 Fast

medium
Grok 4.1 Fast is deprecated. xAI recommends switching to Grok 4.3 (https://openrouter.ai/x-ai/grok-4.3)
Biaya
$0.000
Waktu
0.1s
Token
0 tok

#3 Gemini 3 Flash Preview

medium
Biaya
$0.010
Waktu
18.4s
Token
3,351 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
Grok 4.20 Beta 3.3 3.3 33.3% 0 31.36s 360 81 3,987
Grok 4.20 Multi Agent Beta 3.3 3.3 33.3% 0 27.11s 13,212 86 13,141
Grok 4.1 Fast 7.8 4.0 11.1% 1 23.58s 1,167 821 6,703
Gemini 3 Flash Preview 8.6 7.6 88.9% 1 84.40s 8,122 462 161,084

Perbandingan Cepat

Ganti Pasangan Perbandingan