Navigation
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Verglichene Modelle

Benchmark-Vergleich Grok 4.20 (medium) vs Grok 4.20 Beta (medium) vs Grok 4.3 (medium): Grok 4.3 (medium) führt bei Punktzahl mit 7.1. Grok 4.20 (medium) führt bei Zuverlässigkeit mit 10.0. Grok 4.20 Beta (medium) hat den niedrigsten Gesamtkosten mit $0.750. Grok 4.20 Beta (medium) ist mit 9.75s am schnellsten.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-08-01

Rang
#90
Gesamte Ausgabe-Token
259,340
Antwortzeit (Durchschnitt)
29.47s
Gesamtkosten
$0.777
Rang
#152
Gesamte Ausgabe-Token
93,212
Antwortzeit (Durchschnitt)
9.75s
Gesamtkosten
$0.750
Rang
#88
Gesamte Ausgabe-Token
241,421
Antwortzeit (Durchschnitt)
47.45s
Gesamtkosten
$0.779
Empfohlenes Modell Grok 4.20 (medium)

Es hat die stärkste Punktzahl in diesem Vergleich (7.1) und die beste Gesamtbalance aus Kosten und Antwortzeit über alle 3 Modelle.

Detaillierter Vergleich

Metrik Grok 4.20 Grok 4.20 medium Veröffentlichung: 2026-03-31 Grok 4.20 Beta Grok 4.20 Beta medium Veröffentlichung: 2026-03-12 Grok 4.3 Grok 4.3 medium Veröffentlichung: 2026-05-01
Punktzahl 7.1 6.0 7.1
Rang #90 #152 #88
Zuverlässigkeit 10.0 k. A. 10.0
Konsistenz 8.5 7.8 8.6
Korrekte Tests
Erfolgsquote pro Versuch 63.6% 66.7% 68.2%
Instabile Tests 4 1 4
Gesamtläufe 66 52 66
Kosten pro Ergebnis 9.709 4.505 5.990
Gesamtkosten $0.777 $0.750 $0.779
Eingabepreis $1.250 / 1M $5.805 / 1M $1.250 / 1M
Ausgabepreis $2.500 / 1M $5.805 / 1M $2.500 / 1M
Gesamte Eingabe-Token 102,791 35,955 140,031
Ausgabe-Token 5,363 1,647 13,739
Denk-Token 253,977 91,565 227,682
Antwortzeit (Durchschnitt) 29.47s 9.75s 47.45s
Antwortzeit (Maximum) 199.66s 31.36s 216.69s
Antwortzeit (Gesamt) 648.35s 175.48s 1043.83s

Modell-Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#90 xAI: Grok 4.20

medium
Kosten
$0.041
Zeit
110.3s
Token
16,336 tok

#152 Grok 4.20 Beta

medium
Kosten
$0.034
Zeit
91.0s
Token
13,523 tok

#88 xAI: Grok 4.3

medium
Kosten
$0.009
Zeit
19.0s
Token
3,661 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Grok 4.20 6.3 6.6 55.6% 1 109.93s 8,307 268 103,150
Grok 4.20 Beta 3.3 3.3 33.3% 0 31.36s 360 81 3,987
Grok 4.3 5.9 7.7 44.4% 1 41.23s 8,340 1,028 31,226

Schnellvergleich

Vergleichspaar wechseln