Navigatie
AI BENCHY
Advertise here

AI BENCHY Compare

OpenAI: GPT-5.3-Codex vs OpenAI: GPT-5.4

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-06-04

Metriek GPT-5.3-Codex GPT-5.3-Codex medium Releasedatum: 2026-02-05 GPT-5.4 GPT-5.4 medium Releasedatum: 2026-03-05
Score 8.4 8.0
Rang #15 #21
Betrouwbaarheid 10.0 10.0
Consistentie 8.5 8.6
Correcte tests
Slaagpercentage per poging 82.5% 76.2%
Instabiele tests 4 4
Totaal runs 63 63
Kosten per resultaat 4.932 8.640
Totale kosten $0.740 $1.210
Invoerprijs $1.750 / 1M $2.500 / 1M
Uitvoerprijs $14.000 / 1M $15.000 / 1M
Totaal aantal invoer-tokens 34,299 34,108
Uitvoer-tokens 2,357 2,242
Redeneer-tokens 46,189 72,707
Responstijd (gem.) 16.22s 22.35s
Responstijd (max) 100.93s 100.41s
Responstijd (totaal) 340.67s 469.29s

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Anti-AI-trucs Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.3-Codex 8.7 7.9 91.7% 1 4.16s 606 240 1,722
GPT-5.4 8.3 10.0 75.0% 0 4.11s 606 240 1,511
Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
GPT-5.4 8.8 7.8 88.9% 1 44.36s 7,305 433 24,216
Gecombineerd Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.56s 11,019 364 2,731
GPT-5.4 10.0 10.0 100.0% 0 20.57s 11,019 301 3,543
Gegevensparsering en extractie Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.3-Codex 10.0 10.0 100.0% 0 3.07s 7,140 234 728
GPT-5.4 10.0 10.0 100.0% 0 5.32s 7,140 234 804
Domeinspecifiek Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.3-Codex 5.9 7.2 55.6% 1 64.31s 813 64 25,308
GPT-5.4 5.3 7.2 44.4% 1 74.27s 619 61 34,748
Algemene intelligentie Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.3-Codex 4.6 10.0 0.0% 0 4.87s 477 187 331
GPT-5.4 4.7 3.1 33.3% 1 4.92s 477 145 321
Instructies opvolgen Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.3-Codex 10.0 10.0 100.0% 0 3.04s 660 93 693
GPT-5.4 10.0 10.0 100.0% 0 3.11s 660 93 897
Puzzeloplossing Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.3-Codex 9.0 7.9 88.9% 1 5.05s 642 356 1,593
GPT-5.4 8.2 7.2 88.9% 1 9.14s 642 441 3,815
Toolaanroepen Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.3-Codex 10.0 10.0 100.0% 0 6.37s 5,445 254 492
GPT-5.4 10.0 10.0 100.0% 0 13.28s 5,445 264 1,031
Algemene kennis Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.3-Codex 2.8 1.6 33.3% 1 14.43s 195 30 1,701
GPT-5.4 3.0 10.0 0.0% 0 13.95s 195 30 1,821

Snelle vergelijking

Vergelijkingspaar wisselen