Navigatie
Advertise here

Mercury 2.5 Preview (medium) vs GPT-5.6 Luna (low)

De gemiddelde score is vrijwel gelijk met 6.8 vs 6.9. Mercury 2.5 Preview (medium) heeft lagere benchmarkkosten met $0.037 vs $0.075. Mercury 2.5 Preview (medium) is sneller met 6.66s vs 6.96s, met slagingspercentages van 66.7% vs 56.5%.

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-10-01

Vergeleken modellen

Rang
#171
Totaal aantal uitvoer-tokens
150,107
Responstijd (gem.)
6.66s
Totale kosten
$0.037
Rang
#165
Totaal aantal uitvoer-tokens
28,001
Responstijd (gem.)
6.96s
Totale kosten
$0.075
Aanbevolen model Mercury 2.5 Preview (medium)

Het heeft hier de beste score (6.8) en kost ongeveer 2.0x minder dan GPT-5.6 Luna (low).

Gedetailleerde vergelijking

Metriek Mercury 2.5 Preview Mercury 2.5 Preview medium Releasedatum: 2026-09-02 GPT-5.6 Luna GPT-5.6 Luna low Releasedatum: 2026-07-09
Score 6.8 6.9
Rang #171 #165
Betrouwbaarheid 10.0 10.0
Consistentie 9.6 8.3
Pogingen 69/69 69/69
Correcte tests
Slaagpercentage per poging 66.7% 56.5%
Instabiele tests 1 5
Totaal runs 69 69
Kosten per resultaat 0.244 2.428
Totale kosten $0.037 $0.075
Invoerprijs $0.000 / 1M $0.200 / 1M
Uitvoerprijs $0.000 / 1M $1.200 / 1M
Totaal aantal invoer-tokens 397,291 202,680
Uitvoer-tokens 6,355 9,230
Redeneer-tokens 143,752 18,771
Responstijd (gem.) 6.66s 6.96s
Responstijd (max) 74.63s 45.74s
Responstijd (totaal) 153.29s 160.19s
Parameters ~100B ~400B totaal (~17B actief)
Beschikbaarheid Gesloten broncode Gesloten broncode

Model generatie-showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#171 Mercury 2.5 Preview

medium
Kosten
$0.001
Tijd
2.7s
Tokens
2,241 tok

#165 GPT-5.6 Luna

low
Kosten
$0.011
Tijd
10.2s
Tokens
1,897 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Mercury 2.5 Preview 7.8 10.0 66.7% 0 3.86s 7,839 552 22,126
GPT-5.6 Luna 5.5 10.0 33.3% 0 4.61s 7,302 557 3,535

Snelle vergelijking

Vergelijkingspaar wisselen