- Rang
- #293
- Gesamte Ausgabe-Token
- 40,302
- Antwortzeit (Durchschnitt)
- 3.34s
- Gesamtkosten
- $0.020
Mercury 2.5 (low) vs KAT Coder AIR V2.5 (high)
KAT Coder AIR V2.5 (high) führt beim Durchschnittsscore mit 5.2 vs 5.1. Mercury 2.5 (low) hat die niedrigeren Benchmark-Kosten mit $0.020 vs $0.077. Mercury 2.5 (low) ist schneller mit 3.34s vs 15.23s, mit Erfolgsraten von 37.7% vs 40.6%.
Verglichene Modelle
- Rang
- #288
- Gesamte Ausgabe-Token
- 114,654
- Antwortzeit (Durchschnitt)
- 15.23s
- Gesamtkosten
- $0.077
Empfohlenes Modell
Mercury 2.5 (low)
Die Punktzahl bleibt nah an der besten hier (5.1 vs 5.2) und es kostet etwa 4.0x weniger als KAT Coder AIR V2.5 (high).
Detaillierter Vergleich
| Metrik | Mercury 2.5 Mercury 2.5 low | KAT Coder AIR V2.5 KAT Coder AIR V2.5 high |
|---|---|---|
| Punktzahl | 5.1 | 5.2 |
| Rang | #293 | #288 |
| Zuverlässigkeit | 9.8 | 9.8 |
| Konsistenz | 8.2 | 8.2 |
| Versuche | 69/69 | 69/69 |
| Korrekte Tests | ||
| Erfolgsquote pro Versuch | 37.7% | 40.6% |
| Instabile Tests | 5 | 5 |
| Gesamtläufe | 69 | 69 |
| Kosten pro Ergebnis | 0.319 | 1.091 |
| Gesamtkosten | $0.020 | $0.077 |
| Eingabepreis | $0.040 / 1M | $0.000 / 1M |
| Ausgabepreis | $0.150 / 1M | $0.000 / 1M |
| Gesamte Eingabe-Token | 326,083 | 50,423 |
| Ausgabe-Token | 7,224 | 4,144 |
| Denk-Token | 33,078 | 110,510 |
| Antwortzeit (Durchschnitt) | 3.34s | 15.23s |
| Antwortzeit (Maximum) | 47.06s | 118.35s |
| Antwortzeit (Gesamt) | 76.80s | 350.26s |
| Parameter | ~100B | ~35B insgesamt (~3B aktiv) |
| Verfügbarkeit | Geschlossen | Geschlossen |
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#293 Mercury 2.5
low- Kosten
- $0.001
- Zeit
- 2.4s
- Token
- 1,236 tok
#288 KAT Coder AIR V2.5
high
Reached the allocated time limit (300 seconds) without receiving showcase output.
- Kosten
- $0.000
- Zeit
- 300.0s
- Token
- 0 tok
Top-Modelle nach Score
Score vs. Gesamtkosten
Antwortzeit (Durchschnitt)
Punktzahl vs Antwortzeit (Durchschnitt)
Gesamte Ausgabe-Token
Punktzahl vs Gesamte Ausgabe-Token
Kategorieaufschlüsselung
| Agentenaufgaben | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Mercury 2.5 | 5.0 | 10.0 | 0.0% | 0 | 47.06s | 188,063 | 1,141 | 5,442 | |
| KAT Coder AIR V2.5 | 3.0 | 10.0 | 0.0% | 0 | 1.10s | 0 | 0 | 0 |
| Anti-KI-Tricks | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Mercury 2.5 | 6.9 | 7.9 | 66.7% | 1 | 799ms | 772 | 209 | 2,969 | |
| KAT Coder AIR V2.5 | 6.9 | 5.8 | 75.0% | 2 | 2.49s | 615 | 204 | 1,290 |
| Programmierung | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Mercury 2.5 | 5.5 | 10.0 | 33.3% | 0 | 972ms | 7,909 | 521 | 2,269 | |
| KAT Coder AIR V2.5 | 4.3 | 7.3 | 11.1% | 1 | 39.07s | 6,948 | 1,166 | 55,883 |
| Kombiniert | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Mercury 2.5 | 3.0 | 10.0 | 0.0% | 0 | 5.16s | 107,683 | 3,750 | 11,351 | |
| KAT Coder AIR V2.5 | 6.5 | 10.0 | 50.0% | 0 | 74.48s | 23,854 | 485 | 28,559 |
| Datenanalyse und -extraktion | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Mercury 2.5 | 6.5 | 10.0 | 50.0% | 0 | 1.06s | 8,322 | 739 | 1,499 | |
| KAT Coder AIR V2.5 | 6.5 | 10.0 | 50.0% | 0 | 3.59s | 7,776 | 284 | 2,140 |
| Domänenspezifisch | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Mercury 2.5 | 3.6 | 7.2 | 22.2% | 1 | 846ms | 851 | 57 | 2,265 | |
| KAT Coder AIR V2.5 | 3.0 | 10.0 | 0.0% | 0 | 7.28s | 724 | 1,101 | 7,738 |
| Allgemeine Intelligenz | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Mercury 2.5 | 4.4 | 9.9 | 0.0% | 0 | 819ms | 525 | 99 | 748 | |
| KAT Coder AIR V2.5 | 5.1 | 10.0 | 0.0% | 0 | 7.10s | 516 | 179 | 539 |
| Befolgung von Anweisungen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Mercury 2.5 | 2.9 | 6.0 | 16.7% | 1 | 972ms | 518 | 48 | 1,026 | |
| KAT Coder AIR V2.5 | 9.8 | 10.0 | 100.0% | 0 | 1.51s | 699 | 90 | 675 |
| Rätsellösen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Mercury 2.5 | 5.9 | 4.5 | 66.7% | 2 | 792ms | 768 | 249 | 2,214 | |
| KAT Coder AIR V2.5 | 3.5 | 4.4 | 33.3% | 2 | 2.47s | 696 | 285 | 1,576 |
| Werkzeugaufrufe | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Mercury 2.5 | 9.8 | 10.0 | 100.0% | 0 | 2.72s | 10,440 | 388 | 2,537 | |
| KAT Coder AIR V2.5 | 10.0 | 10.0 | 100.0% | 0 | 4.77s | 8,391 | 330 | 1,082 |
| Allgemeinwissen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Mercury 2.5 | 3.0 | 10.0 | 0.0% | 0 | 782ms | 232 | 23 | 758 | |
| KAT Coder AIR V2.5 | 3.0 | 10.0 | 0.0% | 0 | 21.72s | 204 | 20 | 11,028 |
Schnellvergleich
Vergleichspaar wechseln
Mercury 2.5lowvsKAT Coder AIR V2.5mediumMercury 2.5lowvsMiMo-V2.5-PrononeMercury 2.5lowvsMistral Small 4noneMercury 2.5lowvsMistral Small 4mediumLing 3.0 FlashnonevsKAT Coder AIR V2.5highKAT Coder AIR V2.5highvsInkling SmalllowKostenlos verfügbarKAT Coder AIR V2.5highvsMistral Small 4mediumKAT Coder AIR V2.5highvsMistral Small 4noneMercury 2.5lowvsLaguna S 2.1mediumKostenlos verfügbarKAT Coder AIR V2.5highvsMiMo-V2.5-PrononeMercury 2.5lowvsNemotron 3.5 LightninghighKostenlos verfügbarMercury 2.5lowvsLing 3.0 Flashnone