- Rang
- #166
- Gesamte Ausgabe-Token
- 32,443
- Antwortzeit (Durchschnitt)
- 7.46s
- Gesamtkosten
- $0.909
Claude Sonnet 5.5 (low) vs Mercury 2.5 Preview (medium)
Der Durchschnittsscore ist mit 6.9 vs 6.8 praktisch gleichauf. Mercury 2.5 Preview (medium) hat die niedrigeren Benchmark-Kosten mit $0.037 vs $0.909. Mercury 2.5 Preview (medium) ist schneller mit 6.66s vs 7.46s, mit Erfolgsraten von 46.4% vs 66.7%.
Verglichene Modelle
- Rang
- #171
- Gesamte Ausgabe-Token
- 150,107
- Antwortzeit (Durchschnitt)
- 6.66s
- Gesamtkosten
- $0.037
Empfohlenes Modell
Mercury 2.5 Preview (medium)
Es hat hier die beste Punktzahl (6.8) und kostet etwa 24.8x weniger als Claude Sonnet 5.5 (low).
Detaillierter Vergleich
| Metrik | Claude Sonnet 5.5 Claude Sonnet 5.5 low | Mercury 2.5 Preview Mercury 2.5 Preview medium |
|---|---|---|
| Punktzahl | 6.9 | 6.8 |
| Rang | #166 | #171 |
| Zuverlässigkeit | 10.0 | 10.0 |
| Konsistenz | 9.4 | 9.6 |
| Versuche | 69/69 | 69/69 |
| Korrekte Tests | ||
| Erfolgsquote pro Versuch | 46.4% | 66.7% |
| Instabile Tests | 2 | 1 |
| Gesamtläufe | 69 | 69 |
| Kosten pro Ergebnis | 9.082 | 0.244 |
| Gesamtkosten | $0.909 | $0.037 |
| Eingabepreis | $2.000 / 1M | $0.000 / 1M |
| Ausgabepreis | $10.000 / 1M | $0.000 / 1M |
| Gesamte Eingabe-Token | 291,853 | 397,291 |
| Ausgabe-Token | 24,116 | 6,355 |
| Denk-Token | 8,327 | 143,752 |
| Antwortzeit (Durchschnitt) | 7.46s | 6.66s |
| Antwortzeit (Maximum) | 46.61s | 74.63s |
| Antwortzeit (Gesamt) | 171.47s | 153.29s |
| Parameter | ~1T insgesamt (~100B aktiv) | ~100B |
| Verfügbarkeit | Geschlossen | Geschlossen |
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#166 Claude Sonnet 5.5
low- Kosten
- $0.020
- Zeit
- 15.3s
- Token
- 2,077 tok
#171 Mercury 2.5 Preview
medium- Kosten
- $0.001
- Zeit
- 2.7s
- Token
- 2,241 tok
Top-Modelle nach Score
Score vs. Gesamtkosten
Antwortzeit (Durchschnitt)
Punktzahl vs Antwortzeit (Durchschnitt)
Gesamte Ausgabe-Token
Punktzahl vs Gesamte Ausgabe-Token
Kategorieaufschlüsselung
| Agentenaufgaben | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5.5 | 10.0 | 10.0 | 100.0% | 0 | 46.61s | 125,435 | 2,660 | 1,153 | |
| Mercury 2.5 Preview | 3.9 | 9.6 | 0.0% | 0 | 74.63s | 284,578 | 919 | 22,154 |
| Anti-KI-Tricks | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5.5 | 6.5 | 10.0 | 50.0% | 0 | 2.55s | 858 | 1,736 | 0 | |
| Mercury 2.5 Preview | 10.0 | 10.0 | 100.0% | 0 | 1.43s | 781 | 203 | 7,921 |
| Programmierung | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5.5 | 3.2 | 9.7 | 0.0% | 0 | 5.81s | 10,608 | 5,903 | 0 | |
| Mercury 2.5 Preview | 7.8 | 10.0 | 66.7% | 0 | 3.86s | 7,839 | 552 | 22,126 |
| Kombiniert | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5.5 | 7.9 | 6.9 | 66.7% | 1 | 22.50s | 128,879 | 7,220 | 4,027 | |
| Mercury 2.5 Preview | 6.5 | 10.0 | 50.0% | 0 | 13.86s | 92,663 | 3,607 | 41,588 |
| Datenanalyse und -extraktion | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5.5 | 10.0 | 10.0 | 100.0% | 0 | 2.31s | 10,515 | 312 | 0 | |
| Mercury 2.5 Preview | 10.0 | 10.0 | 100.0% | 0 | 2.77s | 8,292 | 514 | 11,354 |
| Domänenspezifisch | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5.5 | 3.0 | 10.0 | 0.0% | 0 | 8.09s | 990 | 3,974 | 2,570 | |
| Mercury 2.5 Preview | 5.3 | 7.2 | 44.4% | 1 | 3.72s | 853 | 62 | 17,120 |
| Allgemeine Intelligenz | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5.5 | 4.8 | 3.2 | 33.3% | 1 | 2.33s | 714 | 374 | 0 | |
| Mercury 2.5 Preview | 5.0 | 10.0 | 0.0% | 0 | 2.09s | 538 | 99 | 3,375 |
| Befolgung von Anweisungen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5.5 | 6.3 | 10.0 | 50.0% | 0 | 1.91s | 921 | 357 | 0 | |
| Mercury 2.5 Preview | 9.8 | 10.0 | 100.0% | 0 | 1.35s | 744 | 96 | 3,987 |
| Rätsellösen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5.5 | 7.7 | 10.0 | 66.7% | 0 | 2.50s | 912 | 892 | 0 | |
| Mercury 2.5 Preview | 10.0 | 10.0 | 100.0% | 0 | 1.87s | 771 | 274 | 7,323 |
| Werkzeugaufrufe | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5.5 | 10.0 | 10.0 | 100.0% | 0 | 4.67s | 11,757 | 354 | 0 | |
| Mercury 2.5 Preview | 3.0 | 10.0 | 0.0% | 0 | 2.37s | 0 | 0 | 0 |
| Allgemeinwissen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5.5 | 3.0 | 10.0 | 0.0% | 0 | 4.97s | 264 | 334 | 577 | |
| Mercury 2.5 Preview | 3.0 | 10.0 | 0.0% | 0 | 4.13s | 232 | 29 | 6,804 |
Schnellvergleich
Vergleichspaar wechseln
Mercury 2.5 PreviewmediumvsInklinglowKostenlos verfügbarClaude Sonnet 5.5lowvsGemma 4 31BmediumKostenlos verfügbarMercury 2.5 PreviewmediumvsGPT-6 SolnoneClaude Sonnet 5.5lowvsEmber-1highClaude Sonnet 5.5lowvsKimi K2.6mediumClaude Sonnet 5.5lowvsGemini 3.1 Flash LitemediumClaude Sonnet 5.5lowvsQwen3.5-FlashmediumClaude Opus 4.8nonevsMercury 2.5 PreviewmediumMercury 2.5 PreviewmediumvsGPT-5.6 LunalowClaude Sonnet 5.5lowvsGPT-6 SolnoneEmber-1highvsMercury 2.5 PreviewmediumMercury 2.5 PreviewmediumvsSpace Bunny Alphamax