Navigatie
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Google: Gemini 2.5 Flash vs OpenAI: GPT-5.4

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-03-15

Metriek Gemini 2.5 Flash Gemini 2.5 Flash medium Releasedatum: 2025-06-17 GPT-5.4 GPT-5.4 medium Releasedatum: 2026-03-05
Rang #15 #9
Score 8.0 8.5
Consistentie 9.5 8.5
Kosten per resultaat 2.619 6.601
Totale kosten $0.288 $0.793
Correcte tests
Slaagpercentage per poging 72.9% 83.3%
Instabiele tests 1 3
Totaal runs 48 48
Uitvoer-tokens 1,370 1,756
Redeneer-tokens 110,522 46,642
Responstijd (gem.) 12.35s 20.05s
Responstijd (max) 95.48s 100.41s
Responstijd (totaal) 197.62s 320.87s

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Anti-AI-trucs Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Gemini 2.5 Flash 7.8 10.0 66.7% 0 6.98s 249 8,832
GPT-5.4 10.0 10.0 100.0% 0 5.02s 216 1,466
Gecombineerd Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Gemini 2.5 Flash 10.0 10.0 100.0% 0 28.44s 303 11,922
GPT-5.4 10.0 10.0 100.0% 0 20.57s 301 3,543
Gegevensparsering en extractie Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Gemini 2.5 Flash 10.0 10.0 100.0% 0 4.06s 279 2,325
GPT-5.4 10.0 10.0 100.0% 0 5.32s 234 804
Domeinspecifiek Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Gemini 2.5 Flash 5.9 7.2 55.6% 1 37.34s 18 80,702
GPT-5.4 5.3 7.2 44.4% 1 74.27s 61 34,748
Algemene intelligentie Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Gemini 2.5 Flash 4.8 10.0 0.0% 0 4.86s 92 1,899
GPT-5.4 4.7 3.1 33.3% 1 4.92s 145 321
Instructies opvolgen Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Gemini 2.5 Flash 9.8 10.0 100.0% 0 2.62s 69 1,203
GPT-5.4 10.0 10.0 100.0% 0 3.11s 93 897
Puzzle Solving Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Gemini 2.5 Flash 7.7 10.0 66.7% 0 3.94s 126 2,499
GPT-5.4 8.2 7.2 88.9% 1 9.13s 442 3,832
Toolaanroepen Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Gemini 2.5 Flash 10.0 10.0 100.0% 0 6.20s 234 1,140
GPT-5.4 10.0 10.0 100.0% 0 13.28s 264 1,031

Snelle vergelijking

Vergelijkingspaar wisselen