Navigatie
AI BENCHY
Advertise here

Claude Opus 4.8 (low) vs GPT-5.6 Luna (high)

Claude Opus 4.8 (low) leidt in gemiddelde score met 7.8 vs 7.6. GPT-5.6 Luna (high) heeft lagere benchmarkkosten met $0.179 vs $2.089. Claude Opus 4.8 (low) is sneller met 12.88s vs 16.49s, met slagingspercentages van 80.3% vs 69.7%.

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-08-20

Rang
#70
Totaal aantal uitvoer-tokens
52,237
Responstijd (gem.)
12.88s
Totale kosten
$2.089
Rang
#78
Totaal aantal uitvoer-tokens
135,315
Responstijd (gem.)
16.49s
Totale kosten
$0.179
Aanbevolen model GPT-5.6 Luna (high)

De score blijft dicht bij de beste score hier (7.6 vs 7.8) en het kost ongeveer 11.7x minder dan Claude Opus 4.8 (low).

Gedetailleerde vergelijking

Metriek Claude Opus 4.8 Claude Opus 4.8 low Releasedatum: 2026-05-28 GPT-5.6 Luna GPT-5.6 Luna high Releasedatum: 2026-07-09
Score 7.8 7.6
Rang #70 #78
Betrouwbaarheid 10.0 10.0
Consistentie 8.9 8.5
Pogingen 66/66 66/66
Correcte tests
Slaagpercentage per poging 80.3% 69.7%
Instabiele tests 3 4
Totaal runs 66 66
Kosten per resultaat 13.054 6.100
Totale kosten $2.089 $0.179
Invoerprijs $5.000 / 1M $0.200 / 1M
Uitvoerprijs $25.000 / 1M $1.200 / 1M
Totaal aantal invoer-tokens 156,522 80,927
Uitvoer-tokens 43,056 5,088
Redeneer-tokens 9,181 130,227
Responstijd (gem.) 12.88s 16.49s
Responstijd (max) 127.97s 111.09s
Responstijd (totaal) 283.32s 362.78s
Parameters ~5T totaal (~500B actief) ~400B totaal (~17B actief)
Beschikbaarheid Gesloten broncode Gesloten broncode

Model generatie-showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#70 Claude Opus 4.8

low
Kosten
$0.031
Tijd
14.1s
Tokens
1,345 tok

#78 GPT-5.6 Luna

high
Kosten
$0.033
Tijd
34.2s
Tokens
5,484 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Claude Opus 4.8 6.6 4.6 77.8% 2 7.58s 10,590 3,637 809
GPT-5.6 Luna 5.5 4.7 55.6% 2 15.63s 7,302 510 17,746

Snelle vergelijking

Vergelijkingspaar wisselen