Navigation
AI BENCHY
Advertise here

Mercury 2.5 Preview (low) vs Hy4 preview

Mercury 2.5 Preview (low) führt beim Durchschnittsscore mit 5.0 vs 4.8. Mercury 2.5 Preview (low) hat die niedrigeren Benchmark-Kosten mit $0.011 vs $0.041. Mercury 2.5 Preview (low) ist schneller mit 1.31s vs 39.24s, mit Erfolgsraten von 47.0% vs 16.7%.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-09-02

Rang
#254
Gesamte Ausgabe-Token
31,975
Antwortzeit (Durchschnitt)
1.31s
Gesamtkosten
$0.011
Rang
#262
Gesamte Ausgabe-Token
7,306
Antwortzeit (Durchschnitt)
39.24s
Gesamtkosten
$0.041
Empfohlenes Modell Mercury 2.5 Preview (low)

Es hat hier die beste Punktzahl (5.0) und kostet etwa 4.0x weniger als Hy4 preview.

Detaillierter Vergleich

Metrik Mercury 2.5 Preview Mercury 2.5 Preview low Veröffentlichung: 2026-09-02 Hy4 preview Hy4 preview none Veröffentlichung: 2026-08-29
Punktzahl 5.0 4.8
Rang #254 #262
Zuverlässigkeit 10.0 4.3
Konsistenz 7.0 9.3
Versuche 66/66 66/66
Korrekte Tests
Erfolgsquote pro Versuch 47.0% 16.7%
Instabile Tests 8 1
Gesamtläufe 66 66
Kosten pro Ergebnis 0.169 1.343
Gesamtkosten $0.011 $0.041
Eingabepreis $0.040 / 1M $0.834 / 1M
Ausgabepreis $0.150 / 1M $2.501 / 1M
Gesamte Eingabe-Token 133,525 26,376
Ausgabe-Token 7,259 7,306
Denk-Token 24,716 0
Antwortzeit (Durchschnitt) 1.31s 39.24s
Antwortzeit (Maximum) 7.29s 95.32s
Antwortzeit (Gesamt) 28.77s 863.30s
Parameter ~100B 770B insgesamt (49B aktiv)
Verfügbarkeit Geschlossen Open Source

Modell-Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#254 Mercury 2.5 Preview

low
Kosten
$0.001
Zeit
1.5s
Token
1,169 tok

#262 Hy4 preview

none
This operation was aborted
Kosten
$0.000
Zeit
0.0s
Token
0 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Mercury 2.5 Preview 5.5 10.0 33.3% 0 972ms 7,794 695 2,263
Hy4 preview 3.8 9.4 0.0% 0 45.53s 6,646 4,103 0

Schnellvergleich

Vergleichspaar wechseln