Navigatie
AI BENCHY
Advertise here

Inception: Mercury 2 vs Kwaipilot: KAT-Coder-Pro V2.5

KAT-Coder-Pro V2.5 (high) leidt in gemiddelde score met 7.2 vs 7.0. Mercury 2 (medium) heeft lagere benchmarkkosten met $0.093 vs $0.482. Mercury 2 (medium) is sneller met 2.72s vs 20.83s, met slagingspercentages van 51.5% vs 63.6%.

Aanbevolen modelMercury 2 (medium)De score blijft dicht bij de beste score hier (7.0 vs 7.2) en het kost ongeveer 5.2x minder dan KAT-Coder-Pro V2.5 (high).

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-07-18

Metriek Mercury 2 Mercury 2 medium Releasedatum: 2026-02-24 KAT-Coder-Pro V2.5 KAT-Coder-Pro V2.5 high Releasedatum: 2026-07-14
Score 7.0 7.2
Rang #77 #68
Betrouwbaarheid 10.0 10.0
Consistentie 8.8 7.8
Correcte tests
Slaagpercentage per poging 51.5% 63.6%
Instabiele tests 3 6
Totaal runs 66 66
Kosten per resultaat 0.928 4.378
Totale kosten $0.093 $0.482
Invoerprijs $0.250 / 1M $0.740 / 1M
Uitvoerprijs $0.750 / 1M $2.960 / 1M
Totaal aantal invoer-tokens 109,572 106,076
Uitvoer-tokens 10,313 9,071
Redeneer-tokens 76,806 127,093
Responstijd (gem.) 2.72s 20.83s
Responstijd (max) 14.63s 199.97s
Responstijd (totaal) 57.12s 458.31s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#77 Mercury 2

medium
Kosten
$0.002
Tijd
2.1s
Tokens
1,702 tok

#68 KAT-Coder-Pro V2.5

high
Kosten
$0.009
Tijd
26.4s
Tokens
3,117 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
KAT-Coder-Pro V2.5 6.4 7.9 44.4% 1 22.00s 7,893 422 20,461

Snelle vergelijking

Vergelijkingspaar wisselen