Navigation
Advertise here

Mercury 2.5 (medium) vs LongCat 2.0 (low)

Mercury 2.5 (medium) führt beim Durchschnittsscore mit 6.8 vs 6.7. Mercury 2.5 (medium) hat die niedrigeren Benchmark-Kosten mit $0.022 vs $0.412. Mercury 2.5 (medium) ist schneller mit 3.19s vs 113.61s, mit Erfolgsraten von 65.2% vs 54.6%.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-09-08

Verglichene Modelle

Rang
#157
Gesamte Ausgabe-Token
120,129
Antwortzeit (Durchschnitt)
3.19s
Gesamtkosten
$0.022
Rang
#162
Gesamte Ausgabe-Token
320,594
Antwortzeit (Durchschnitt)
113.61s
Gesamtkosten
$0.412
Empfohlenes Modell Mercury 2.5 (medium)

Es hat hier die beste Punktzahl (6.8) und kostet etwa 19.0x weniger als LongCat 2.0 (low).

Detaillierter Vergleich

Metrik Mercury 2.5 Mercury 2.5 medium Veröffentlichung: 2026-09-08 LongCat 2.0 LongCat 2.0 low Veröffentlichung: 2026-07-20
Punktzahl 6.8 6.7
Rang #157 #162
Zuverlässigkeit 9.8 9.9
Konsistenz 8.6 8.5
Versuche 66/66 66/66
Korrekte Tests
Erfolgsquote pro Versuch 65.2% 54.6%
Instabile Tests 4 4
Gesamtläufe 66 66
Kosten pro Ergebnis 0.181 4.120
Gesamtkosten $0.022 $0.412
Eingabepreis $0.040 / 1M $0.300 / 1M
Ausgabepreis $0.150 / 1M $1.200 / 1M
Gesamte Eingabe-Token 91,402 90,870
Ausgabe-Token 3,138 5,676
Denk-Token 116,991 314,918
Antwortzeit (Durchschnitt) 3.19s 113.61s
Antwortzeit (Maximum) 9.87s 560.39s
Antwortzeit (Gesamt) 70.18s 2499.46s
Parameter ~100B 1.6T insgesamt (48B aktiv)
Verfügbarkeit Geschlossen Open Source

Modell-Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#157 Mercury 2.5

medium
Kosten
$0.001
Zeit
3.8s
Token
3,386 tok

#162 LongCat 2.0

low
Kosten
$0.024
Zeit
428.0s
Token
19,557 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Mercury 2.5 5.0 5.1 44.5% 2 3.70s 7,807 488 21,857
LongCat 2.0 6.6 4.6 77.8% 2 479.30s 6,544 461 206,627

Schnellvergleich

Vergleichspaar wechseln