Navigatie
AI BENCHY
Advertise here

Claude Opus 4.8 (medium) vs GPT-5.3-Codex (medium)

GPT-5.3-Codex (medium) leidt in gemiddelde score met 8.9 vs 8.8. GPT-5.3-Codex (medium) heeft lagere benchmarkkosten met $0.988 vs $1.983. Claude Opus 4.8 (medium) is sneller met 12.97s vs 16.91s, met slagingspercentages van 83.3% vs 83.3%.

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-08-26

Rang
#26
Totaal aantal uitvoer-tokens
51,927
Responstijd (gem.)
12.97s
Totale kosten
$1.983
Rang
#22
Totaal aantal uitvoer-tokens
60,374
Responstijd (gem.)
16.91s
Totale kosten
$0.988
Aanbevolen model GPT-5.3-Codex (medium)

Het heeft hier de beste score (8.9) en kost ongeveer 2.0x minder dan Claude Opus 4.8 (medium).

Gedetailleerde vergelijking

Metriek Claude Opus 4.8 Claude Opus 4.8 medium Releasedatum: 2026-05-28 GPT-5.3-Codex GPT-5.3-Codex medium Releasedatum: 2026-02-05
Score 8.8 8.9
Rang #26 #22
Betrouwbaarheid 10.0 10.0
Consistentie 9.2 8.6
Pogingen 66/66 66/66
Correcte tests
Slaagpercentage per poging 83.3% 83.3%
Instabiele tests 2 4
Totaal runs 66 66
Kosten per resultaat 11.662 6.171
Totale kosten $1.983 $0.988
Invoerprijs $5.000 / 1M $1.750 / 1M
Uitvoerprijs $25.000 / 1M $14.000 / 1M
Totaal aantal invoer-tokens 138,448 81,187
Uitvoer-tokens 40,765 6,258
Redeneer-tokens 11,162 54,116
Responstijd (gem.) 12.97s 16.91s
Responstijd (max) 70.54s 100.93s
Responstijd (totaal) 285.29s 372.03s
Parameters ~5T totaal (~500B actief) ~1.2T totaal (~80B actief)
Beschikbaarheid Gesloten broncode Gesloten broncode

Model generatie-showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#26 Claude Opus 4.8

medium
Kosten
$0.057
Tijd
23.1s
Tokens
2,412 tok

#22 GPT-5.3-Codex

medium
Kosten
$0.049
Tijd
54.9s
Tokens
3,580 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Claude Opus 4.8 10.0 10.0 100.0% 0 15.33s 10,590 9,945 1,381
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890

Snelle vergelijking

Vergelijkingspaar wisselen