Navigatie
Advertise here

Mercury 2.5 (medium) vs Kimi K2.5 (medium)

De gemiddelde score is vrijwel gelijk met 6.4 vs 6.4. Mercury 2.5 (medium) heeft lagere benchmarkkosten met $0.034 vs $0.841. Mercury 2.5 (medium) is sneller met 7.74s vs 125.76s, met slagingspercentages van 63.8% vs 60.9%.

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-10-03

Vergeleken modellen

Rang
#209
Totaal aantal uitvoer-tokens
138,946
Responstijd (gem.)
7.74s
Totale kosten
$0.034
Rang
#208
Totaal aantal uitvoer-tokens
241,096
Responstijd (gem.)
125.76s
Totale kosten
$0.841
Aanbevolen model Mercury 2.5 (medium)

Het heeft hier de beste score (6.4) en kost ongeveer 25.1x minder dan Kimi K2.5 (medium).

Gedetailleerde vergelijking

Metriek Mercury 2.5 Mercury 2.5 medium Releasedatum: 2026-09-08 Kimi K2.5 Kimi K2.5 medium Releasedatum: 2026-01-27
Score 6.4 6.4
Rang #209 #208
Betrouwbaarheid 9.7 9.6
Consistentie 8.3 7.1
Pogingen 69/69 69/69
Correcte tests
Slaagpercentage per poging 63.8% 60.9%
Instabiele tests 5 8
Totaal runs 69 69
Kosten per resultaat 0.280 6.085
Totale kosten $0.034 $0.841
Invoerprijs $0.040 / 1M $0.450 / 1M
Uitvoerprijs $0.150 / 1M $2.250 / 1M
Prijs voor cachelezen $0.004 / 1M $0.070 / 1M
Prijs voor cacheschrijven n.v.t. n.v.t.
Totaal aantal invoer-tokens 317,982 292,271
Uitvoer-tokens 3,918 55,025
Redeneer-tokens 135,028 186,071
Responstijd (gem.) 7.74s 125.76s
Responstijd (max) 107.89s 566.79s
Responstijd (totaal) 178.07s 2137.84s
Parameters ~100B 1T totaal (32B actief)
Beschikbaarheid Gesloten broncode Gewichten beschikbaar

Cacheprijzen gelden voor invoertokens. Lezen hergebruikt opgeslagen prompts; schrijven slaat ze op en kan extra kosten. Voor uitvoertokens geldt de uitvoerprijs.

Model generatie-showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#209 Mercury 2.5

medium
Kosten
$0.001
Tijd
3.8s
Tokens
3,386 tok

#208 MoonshotAI: Kimi K2.5

medium
Kosten
$0.030
Tijd
58.6s
Tokens
8,683 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Mercury 2.5 5.0 5.1 44.5% 2 3.70s 7,807 488 21,857
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693

Snelle vergelijking

Vergelijkingspaar wisselen