Navigatie
AI BENCHY
Advertise here

AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs OpenAI: GPT-5.3-Codex

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-05-28

Metriek Claude Opus 4.8 Claude Opus 4.8 medium Releasedatum: 2026-05-28 GPT-5.3-Codex GPT-5.3-Codex medium Releasedatum: 2026-02-05
Score 8.7 8.3
Rang #12 #17
Betrouwbaarheid 10.0 10.0
Consistentie 9.6 8.4
Correcte tests
Slaagpercentage per poging 83.3% 81.7%
Instabiele tests 1 4
Totaal runs 60 60
Kosten per resultaat 6.285 4.887
Totale kosten $1.006 $0.685
Invoerprijs $5.000 / 1M $1.750 / 1M
Uitvoerprijs $25.000 / 1M $14.000 / 1M
Uitvoer-tokens 23,201 2,336
Redeneer-tokens 5,901 42,565
Responstijd (gem.) 9.34s 15.95s
Responstijd (max) 38.03s 100.93s
Responstijd (totaal) 186.84s 319.08s

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Anti-AI-trucs Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Claude Opus 4.8 10.0 10.0 100.0% 0 3.95s 1,179 478
GPT-5.3-Codex 8.7 7.9 91.7% 1 4.16s 240 1,722
Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Claude Opus 4.8 10.0 10.0 100.0% 0 14.97s 6,651 1,381
GPT-5.3-Codex 10.0 10.0 100.0% 0 18.45s 514 7,266
Gecombineerd Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Claude Opus 4.8 9.8 10.0 100.0% 0 38.03s 5,260 1,588
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.56s 364 2,731
Gegevensparsering en extractie Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Claude Opus 4.8 7.1 5.6 83.3% 1 12.29s 481 312
GPT-5.3-Codex 10.0 10.0 100.0% 0 3.07s 234 728
Domeinspecifiek Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Claude Opus 4.8 5.3 10.0 33.3% 0 14.15s 7,477 900
GPT-5.3-Codex 5.9 7.2 55.6% 1 64.31s 64 25,308
Algemene intelligentie Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Claude Opus 4.8 10.0 10.0 100.0% 0 2.46s 237 0
GPT-5.3-Codex 4.6 10.0 0.0% 0 4.87s 187 331
Instructies opvolgen Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Claude Opus 4.8 10.0 10.0 100.0% 0 3.32s 373 320
GPT-5.3-Codex 10.0 10.0 100.0% 0 3.04s 93 693
Puzzeloplossing Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Claude Opus 4.8 10.0 10.0 100.0% 0 3.95s 791 483
GPT-5.3-Codex 9.0 7.9 88.9% 1 5.05s 356 1,593
Toolaanroepen Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Claude Opus 4.8 10.0 10.0 100.0% 0 8.96s 301 225
GPT-5.3-Codex 10.0 10.0 100.0% 0 6.37s 254 492
Algemene kennis Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Uitvoer-tokens Redeneer-tokens
Claude Opus 4.8 3.0 10.0 0.0% 0 6.14s 451 214
GPT-5.3-Codex 2.8 1.6 33.3% 1 14.43s 30 1,701

Snelle vergelijking

Vergelijkingspaar wisselen