Navigatie
Advertise here

Mercury 2.5 Preview (medium) vs GPT-5.6 Luna (high)

GPT-5.6 Luna (high) leidt in gemiddelde score met 7.6 vs 7.5. Mercury 2.5 Preview (medium) heeft lagere benchmarkkosten met $0.024 vs $0.179. Mercury 2.5 Preview (medium) is sneller met 3.58s vs 16.49s, met slagingspercentages van 69.7% vs 69.7%.

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-09-08

Vergeleken modellen

Rang
#104
Totaal aantal uitvoer-tokens
127,034
Responstijd (gem.)
3.58s
Totale kosten
$0.024
Rang
#94
Totaal aantal uitvoer-tokens
135,315
Responstijd (gem.)
16.49s
Totale kosten
$0.179
Aanbevolen model Mercury 2.5 Preview (medium)

De score blijft dicht bij de beste score hier (7.5 vs 7.6) en het kost ongeveer 7.6x minder dan GPT-5.6 Luna (high).

Gedetailleerde vergelijking

Metriek Mercury 2.5 Preview Mercury 2.5 Preview medium Releasedatum: 2026-09-02 GPT-5.6 Luna GPT-5.6 Luna high Releasedatum: 2026-07-09
Score 7.5 7.6
Rang #104 #94
Betrouwbaarheid 10.0 10.0
Consistentie 9.6 8.5
Pogingen 66/66 66/66
Correcte tests
Slaagpercentage per poging 69.7% 69.7%
Instabiele tests 1 4
Totaal runs 66 66
Kosten per resultaat 0.158 6.100
Totale kosten $0.024 $0.179
Invoerprijs $0.040 / 1M $0.200 / 1M
Uitvoerprijs $0.150 / 1M $1.200 / 1M
Totaal aantal invoer-tokens 112,713 80,927
Uitvoer-tokens 5,436 5,088
Redeneer-tokens 121,598 130,227
Responstijd (gem.) 3.58s 16.49s
Responstijd (max) 17.84s 111.09s
Responstijd (totaal) 78.66s 362.78s
Parameters ~100B ~400B totaal (~17B actief)
Beschikbaarheid Gesloten broncode Gesloten broncode

Model generatie-showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#104 Mercury 2.5 Preview

medium
Kosten
$0.001
Tijd
2.7s
Tokens
2,241 tok

#94 GPT-5.6 Luna

high
Kosten
$0.033
Tijd
34.2s
Tokens
5,484 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Mercury 2.5 Preview 7.8 10.0 66.7% 0 3.86s 7,839 552 22,126
GPT-5.6 Luna 5.5 4.7 55.6% 2 15.63s 7,302 510 17,746

Snelle vergelijking

Vergelijkingspaar wisselen