Navigation
Advertise here

Mercury 2.5 (low) vs KAT Coder AIR V2.5 (high)

KAT Coder AIR V2.5 (high) führt beim Durchschnittsscore mit 5.2 vs 5.1. Mercury 2.5 (low) hat die niedrigeren Benchmark-Kosten mit $0.020 vs $0.077. Mercury 2.5 (low) ist schneller mit 3.34s vs 15.23s, mit Erfolgsraten von 37.7% vs 40.6%.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-10-01

Verglichene Modelle

Rang
#293
Gesamte Ausgabe-Token
40,302
Antwortzeit (Durchschnitt)
3.34s
Gesamtkosten
$0.020
Rang
#288
Gesamte Ausgabe-Token
114,654
Antwortzeit (Durchschnitt)
15.23s
Gesamtkosten
$0.077
Empfohlenes Modell Mercury 2.5 (low)

Die Punktzahl bleibt nah an der besten hier (5.1 vs 5.2) und es kostet etwa 4.0x weniger als KAT Coder AIR V2.5 (high).

Detaillierter Vergleich

Metrik Mercury 2.5 Mercury 2.5 low Veröffentlichung: 2026-09-08 KAT Coder AIR V2.5 KAT Coder AIR V2.5 high Veröffentlichung: 2026-07-14
Punktzahl 5.1 5.2
Rang #293 #288
Zuverlässigkeit 9.8 9.8
Konsistenz 8.2 8.2
Versuche 69/69 69/69
Korrekte Tests
Erfolgsquote pro Versuch 37.7% 40.6%
Instabile Tests 5 5
Gesamtläufe 69 69
Kosten pro Ergebnis 0.319 1.091
Gesamtkosten $0.020 $0.077
Eingabepreis $0.040 / 1M $0.000 / 1M
Ausgabepreis $0.150 / 1M $0.000 / 1M
Gesamte Eingabe-Token 326,083 50,423
Ausgabe-Token 7,224 4,144
Denk-Token 33,078 110,510
Antwortzeit (Durchschnitt) 3.34s 15.23s
Antwortzeit (Maximum) 47.06s 118.35s
Antwortzeit (Gesamt) 76.80s 350.26s
Parameter ~100B ~35B insgesamt (~3B aktiv)
Verfügbarkeit Geschlossen Geschlossen

Modell-Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#293 Mercury 2.5

low
Kosten
$0.001
Zeit
2.4s
Token
1,236 tok

#288 KAT Coder AIR V2.5

high
Reached the allocated time limit (300 seconds) without receiving showcase output.
Kosten
$0.000
Zeit
300.0s
Token
0 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Mercury 2.5 5.5 10.0 33.3% 0 972ms 7,909 521 2,269
KAT Coder AIR V2.5 4.3 7.3 11.1% 1 39.07s 6,948 1,166 55,883

Schnellvergleich

Vergleichspaar wechseln