Navigatie
AI BENCHY
AD
Track all your projects in one dashboard. Get ๐Ÿ“Šstats, ๐Ÿ”ฅheatmaps and ๐Ÿ‘€recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Vergeleken modellen

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-04-02

Metriek Gemma 4 31B Gemma 4 31B medium Releasedatum: 2026-04-02 Gemini 3 PRO Preview Gemini 3 PRO Preview medium Releasedatum: 2025-11-18 GLM 5 Turbo GLM 5 Turbo medium Releasedatum: 2026-03-15
Score 8.6 8.7 8.0
Rang #5 #4 #19
Consistentie 9.6 10.0 7.9
Correcte tests
Slaagpercentage per poging 80.4% 82.4% 76.5%
Instabiele tests 1 0 5
Totaal runs 51 51 51
Kosten per resultaat 0.109 1.406 1.509
Totale kosten $0.015 $0.197 $0.166
Invoerprijs $0.140 / 1M $0.000 / 1M $1.200 / 1M
Uitvoerprijs $0.400 / 1M $0.000 / 1M $4.000 / 1M
Uitvoer-tokens 9,568 1,508 11,865
Redeneer-tokens 22,501 10,084 35,632
Responstijd (gem.) 21.81s 9.06s 17.98s
Responstijd (max) 68.92s 26.24s 194.23s
Responstijd (totaal) 327.16s 90.58s 305.72s

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Anti-AI-trucs Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Gemma 4 31B 10.0 10.0 100.0% 0 12.89s 962 2,046
Gemini 3 PRO Preview 10.0 10.0 100.0% 0 14.99s 149 1,485
GLM 5 Turbo 10.0 10.0 100.0% 0 4.82s 362 3,137
Gecombineerd Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Gemma 4 31B 3.0 10.0 0.0% 0 0ms 0 0
Gemini 3 PRO Preview 3.0 10.0 0.0% 0 10.37s 351 952
GLM 5 Turbo 10.0 10.0 100.0% 0 13.88s 390 2,037
Gegevensparsering en extractie Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Gemma 4 31B 10.0 10.0 100.0% 0 21.11s 1,822 2,951
Gemini 3 PRO Preview 10.0 10.0 100.0% 0 10.84s 279 3,156
GLM 5 Turbo 10.0 10.0 100.0% 0 6.19s 577 3,632
Domeinspecifiek Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Gemma 4 31B 7.7 10.0 66.7% 0 38.48s 4,349 8,985
Gemini 3 PRO Preview 5.3 10.0 33.3% 0 7.01s 15 1,195
GLM 5 Turbo 2.9 4.4 22.2% 2 71.07s 9,665 19,279
Algemene intelligentie Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Gemma 4 31B 10.0 10.0 100.0% 0 9.57s 105 888
Gemini 3 PRO Preview 10.0 10.0 100.0% 0 9.34s 78 374
GLM 5 Turbo 6.1 3.1 66.7% 1 10.05s 60 2,216
Instructies opvolgen Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Gemma 4 31B 10.0 10.0 100.0% 0 12.76s 533 2,035
Gemini 3 PRO Preview 9.8 10.0 100.0% 0 3.26s 69 754
GLM 5 Turbo 10.0 10.0 100.0% 0 5.38s 255 2,183
Puzzle Solving Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Gemma 4 31B 8.8 7.9 88.9% 1 27.63s 1,797 5,596
Gemini 3 PRO Preview 10.0 10.0 100.0% 0 3.91s 243 1,197
GLM 5 Turbo 7.3 5.8 55.6% 2 5.44s 315 2,702
Toolaanroepen Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Gemma 4 31B 3.0 10.0 0.0% 0 0ms 0 0
Gemini 3 PRO Preview 10.0 10.0 100.0% 0 11.96s 324 971
GLM 5 Turbo 10.0 10.0 100.0% 0 9.84s 241 446

Snelle vergelijking

Vergelijkingspaar wisselen