Navigatie
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Mercury 2.5 (high) vs GPT-6 Luna (low)

De gemiddelde score is vrijwel gelijk met 7.1 vs 7.0. GPT-6 Luna (low) heeft lagere benchmarkkosten met $0.020 vs $0.031. Mercury 2.5 (high) is sneller met 4.32s vs 21.96s, met slagingspercentages van 62.1% vs 62.1%.

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-09-23

Vergeleken modellen

Rang
#156
Totaal aantal uitvoer-tokens
174,547
Responstijd (gem.)
4.32s
Totale kosten
$0.031
Rang
#159
Totaal aantal uitvoer-tokens
22,605
Responstijd (gem.)
21.96s
Totale kosten
$0.020
Aanbevolen model Mercury 2.5 (high)

Het heeft hier de beste score (7.1) en reageert ongeveer 5.1x sneller dan GPT-6 Luna (low).

Gedetailleerde vergelijking

Metriek Mercury 2.5 Mercury 2.5 high Releasedatum: 2026-09-08 GPT-6 Luna GPT-6 Luna low Releasedatum: 2026-09-23
Score 7.1 7.0
Rang #156 #159
Betrouwbaarheid 9.7 9.6
Consistentie 8.6 8.5
Pogingen 66/66 66/66
Correcte tests
Slaagpercentage per poging 62.1% 62.1%
Instabiele tests 4 4
Totaal runs 66 66
Kosten per resultaat 0.259 0.176
Totale kosten $0.031 $0.020
Invoerprijs $0.040 / 1M $0.100 / 1M
Uitvoerprijs $0.150 / 1M $0.500 / 1M
Totaal aantal invoer-tokens 120,068 80,159
Uitvoer-tokens 3,402 4,623
Redeneer-tokens 171,145 17,982
Responstijd (gem.) 4.32s 21.96s
Responstijd (max) 23.63s 89.37s
Responstijd (totaal) 95.06s 483.19s
Parameters ~100B ~400B totaal (~17B actief)
Beschikbaarheid Gesloten broncode Gesloten broncode

Model generatie-showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#156 Mercury 2.5

high
Kosten
$0.001
Tijd
3.5s
Tokens
2,447 tok

#159 GPT-6 Luna

low
Kosten
$0.002
Tijd
19.2s
Tokens
2,598 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Mercury 2.5 6.4 7.8 44.4% 1 6.58s 7,757 415 44,012
GPT-6 Luna 6.0 7.2 55.6% 1 15.39s 7,302 493 6,655

Snelle vergelijking

Vergelijkingspaar wisselen