Navigatie
Advertise here

Claude Sonnet 5.5 (max) vs GPT-5.3-Codex (medium)

Claude Sonnet 5.5 (max) leidt in gemiddelde score met 9.0 vs 8.9. GPT-5.3-Codex (medium) heeft lagere benchmarkkosten met $0.988 vs $7.545. GPT-5.3-Codex (medium) is sneller met 16.91s vs 83.04s, met slagingspercentages van 81.8% vs 83.3%.

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-09-29

Vergeleken modellen

Rang
#39
Totaal aantal uitvoer-tokens
727,349
Responstijd (gem.)
83.04s
Totale kosten
$7.545
Rang
#43
Totaal aantal uitvoer-tokens
60,374
Responstijd (gem.)
16.91s
Totale kosten
$0.988
Aanbevolen model GPT-5.3-Codex (medium)

De score blijft dicht bij de beste score hier (8.9 vs 9.0) en het kost ongeveer 7.6x minder dan Claude Sonnet 5.5 (max).

Gedetailleerde vergelijking

Metriek Claude Sonnet 5.5 Claude Sonnet 5.5 max Releasedatum: 2026-09-29 GPT-5.3-Codex GPT-5.3-Codex medium Releasedatum: 2026-02-05
Score 9.0 8.9
Rang #39 #43
Betrouwbaarheid 10.0 10.0
Consistentie 9.4 8.6
Pogingen 66/66 66/66
Correcte tests
Slaagpercentage per poging 81.8% 83.3%
Instabiele tests 2 4
Totaal runs 66 66
Kosten per resultaat 44.380 6.171
Totale kosten $7.545 $0.988
Invoerprijs $2.000 / 1M $1.750 / 1M
Uitvoerprijs $10.000 / 1M $14.000 / 1M
Totaal aantal invoer-tokens 135,496 81,187
Uitvoer-tokens 8,153 6,258
Redeneer-tokens 719,196 54,116
Responstijd (gem.) 83.04s 16.91s
Responstijd (max) 488.39s 100.93s
Responstijd (totaal) 1826.84s 372.03s
Parameters ~1T totaal (~100B actief) ~1.2T totaal (~80B actief)
Beschikbaarheid Gesloten broncode Gesloten broncode

Model generatie-showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#39 Claude Sonnet 5.5

max
OpenRouter returned no showcase content (finish_reason: length).
Kosten
$0.000
Tijd
571.7s
Tokens
0 tok

#43 GPT-5.3-Codex

medium
Kosten
$0.049
Tijd
54.9s
Tokens
3,580 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Claude Sonnet 5.5 10.0 10.0 100.0% 0 55.26s 10,608 580 70,730
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890

Snelle vergelijking

Vergelijkingspaar wisselen