Navigatie
AI BENCHY
AD
Track all your projects in one dashboard. Get ๐Ÿ“Šstats, ๐Ÿ”ฅheatmaps and ๐Ÿ‘€recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Vergeleken modellen

Samenvatting

Benchmarkvergelijking Grok 4.20 vs Grok 4.20 Beta vs Grok 4.3Grok 4.3 leidt op Score met 7.7. Grok 4.20 leidt op Betrouwbaarheid met 10.0. Grok 4.20 heeft de laagste Totale kosten met $0.609. Grok 4.20 Beta is het snelst met 9.75s.

Aanbevolen model: Grok 4.20 Beta - Het biedt de beste totale afweging: concurrerende score (6.8), snellere respons dan de andere modellen in deze vergelijking en evenwichtige kosten.

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-06-17

Metriek Grok 4.20 Grok 4.20 medium Releasedatum: 2026-03-31 Grok 4.20 Beta Grok 4.20 Beta medium Releasedatum: 2026-03-12 Grok 4.3 Grok 4.3 medium Releasedatum: 2026-05-01
Score 7.3 6.8 7.7
Rang #53 #69 #37
Betrouwbaarheid 10.0 n.v.t. 10.0
Consistentie 8.8 8.2 8.5
Correcte tests
Slaagpercentage per poging 63.5% 69.8% 71.4%
Instabiele tests 3 1 4
Totaal runs 63 52 63
Kosten per resultaat 8.309 4.505 4.724
Totale kosten $0.609 $0.750 $0.614
Invoerprijs $1.250 / 1M $5.805 / 1M $1.250 / 1M
Uitvoerprijs $2.500 / 1M $5.805 / 1M $2.500 / 1M
Totaal aantal invoer-tokens 44,433 35,955 44,472
Uitvoer-tokens 1,819 1,647 1,981
Redeneer-tokens 219,524 91,565 221,382
Responstijd (gem.) 27.68s 9.75s 47.51s
Responstijd (max) 199.66s 31.36s 216.69s
Responstijd (totaal) 581.26s 175.48s 997.68s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#53 xAI: Grok 4.20

medium
Cost
$0.041
Time
110.3s
Tokens
16,336 tok

#69 Grok 4.20 Beta

medium
Cost
$0.034
Time
91.0s
Tokens
13,523 tok

#37 xAI: Grok 4.3

medium
Cost
$0.009
Time
19.0s
Tokens
3,661 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Anti-AI-trucs Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Grok 4.20 8.2 7.9 83.3% 1 3.95s 2,010 287 8,312
Grok 4.20 Beta 8.7 7.9 91.7% 1 3.16s 2,010 268 7,583
Grok 4.3 10.0 10.0 100.0% 0 8.83s 2,010 88 8,207
Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Grok 4.20 6.3 6.6 55.6% 1 109.93s 8,307 268 103,150
Grok 4.20 Beta 3.3 3.3 33.3% 0 31.36s 360 81 3,987
Grok 4.3 5.9 7.7 44.4% 1 41.23s 8,340 1,028 31,226
Gecombineerd Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Grok 4.20 10.0 10.0 100.0% 0 17.40s 12,909 232 9,556
Grok 4.20 Beta 10.0 10.0 100.0% 0 20.93s 12,909 227 12,212
Grok 4.3 10.0 10.0 100.0% 0 63.99s 12,909 234 15,301
Gegevensparsering en extractie Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Grok 4.20 10.0 10.0 100.0% 0 4.17s 7,761 180 5,333
Grok 4.20 Beta 10.0 10.0 100.0% 0 4.01s 7,761 180 5,281
Grok 4.3 10.0 10.0 100.0% 0 18.97s 7,761 180 9,546
Domeinspecifiek Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Grok 4.20 5.3 10.0 33.3% 0 27.03s 1,764 375 49,339
Grok 4.20 Beta 5.3 10.0 33.3% 0 21.33s 1,764 251 40,255
Grok 4.3 5.3 7.2 44.4% 1 181.74s 1,764 14 111,300
Algemene intelligentie Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Grok 4.20 3.9 2.6 33.3% 1 24.48s 825 65 6,440
Grok 4.20 Beta 10.0 10.0 100.0% 0 5.78s 825 72 3,440
Grok 4.3 5.4 2.5 66.7% 1 24.70s 825 70 5,020
Instructies opvolgen Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Grok 4.20 9.8 10.0 100.0% 0 4.26s 1,362 57 6,419
Grok 4.20 Beta 9.8 10.0 100.0% 0 4.89s 1,362 57 7,123
Grok 4.3 9.8 10.0 100.0% 0 18.58s 1,362 57 8,713
Puzzeloplossing Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Grok 4.20 7.7 10.0 66.7% 0 6.22s 1,689 149 7,913
Grok 4.20 Beta 10.0 10.0 100.0% 0 3.52s 1,689 328 6,300
Grok 4.3 5.9 7.2 55.6% 1 22.52s 1,689 128 14,468
Toolaanroepen Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Grok 4.20 3.0 10.0 0.0% 0 13.68s 7,275 197 6,620
Grok 4.20 Beta 3.0 10.0 0.0% 0 12.39s 7,275 183 5,384
Grok 4.3 10.0 10.0 100.0% 0 17.66s 7,263 168 4,615
Algemene kennis Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Grok 4.20 3.0 10.0 0.0% 0 63.48s 531 9 16,442
Grok 4.20 Beta 0.0 0.0 0.0% 0 0ms 0 0 0
Grok 4.3 3.0 10.0 0.0% 0 44.47s 549 14 12,986

Snelle vergelijking

Vergelijkingspaar wisselen