- Rang
- #145
- Gesamte Ausgabe-Token
- 422,234
- Antwortzeit (Durchschnitt)
- 144.88s
- Gesamtkosten
- $0.593
LongCat 2.0 (medium) vs Step 3.7 Flash (low)
Der Durchschnittsscore ist mit 7.2 vs 7.2 praktisch gleichauf. Step 3.7 Flash (low) hat die niedrigeren Benchmark-Kosten mit $0.449 vs $0.593. Step 3.7 Flash (low) ist schneller mit 20.72s vs 144.88s, mit Erfolgsraten von 59.4% vs 63.8%.
Verglichene Modelle
- Rang
- #147
- Gesamte Ausgabe-Token
- 339,108
- Antwortzeit (Durchschnitt)
- 20.72s
- Gesamtkosten
- $0.449
Empfohlenes Modell
Step 3.7 Flash (low)
Es hat hier die beste Punktzahl (7.2) und antwortet etwa 7.0x schneller als LongCat 2.0 (medium).
Detaillierter Vergleich
| Metrik | LongCat 2.0 LongCat 2.0 medium | Step 3.7 Flash Step 3.7 Flash low |
|---|---|---|
| Punktzahl | 7.2 | 7.2 |
| Rang | #145 | #147 |
| Zuverlässigkeit | 10.0 | 10.0 |
| Konsistenz | 9.0 | 7.9 |
| Versuche | 69/69 | 69/69 |
| Korrekte Tests | ||
| Erfolgsquote pro Versuch | 59.4% | 63.8% |
| Instabile Tests | 3 | 6 |
| Gesamtläufe | 69 | 69 |
| Kosten pro Ergebnis | 4.942 | 4.078 |
| Gesamtkosten | $0.593 | $0.449 |
| Eingabepreis | $0.300 / 1M | $0.200 / 1M |
| Ausgabepreis | $1.200 / 1M | $1.150 / 1M |
| Gesamte Eingabe-Token | 287,669 | 292,685 |
| Ausgabe-Token | 47,204 | 339,108 |
| Denk-Token | 375,030 | 0 |
| Antwortzeit (Durchschnitt) | 144.88s | 20.72s |
| Antwortzeit (Maximum) | 939.52s | 124.75s |
| Antwortzeit (Gesamt) | 3332.19s | 476.67s |
| Parameter | 1.6T insgesamt (48B aktiv) | 198B insgesamt (11B aktiv) |
| Verfügbarkeit | Open Source | Open Source |
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#145 LongCat 2.0
medium- Kosten
- $0.016
- Zeit
- 285.1s
- Token
- 13,057 tok
#147 Step 3.7 Flash
low
Ungültiges SVG
- Kosten
- $0.004
- Zeit
- 25.3s
- Token
- 3,072 tok
Top-Modelle nach Score
Score vs. Gesamtkosten
Antwortzeit (Durchschnitt)
Punktzahl vs Antwortzeit (Durchschnitt)
Gesamte Ausgabe-Token
Punktzahl vs Gesamte Ausgabe-Token
Kategorieaufschlüsselung
| Agentenaufgaben | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| LongCat 2.0 | 6.1 | 3.1 | 66.7% | 1 | 174.08s | 190,345 | 2,821 | 28,540 | |
| Step 3.7 Flash | 7.4 | 3.8 | 66.7% | 1 | 83.63s | 188,843 | 18,715 | 0 |
| Anti-KI-Tricks | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| LongCat 2.0 | 10.0 | 10.0 | 100.0% | 0 | 9.65s | 588 | 201 | 4,412 | |
| Step 3.7 Flash | 8.7 | 7.9 | 91.7% | 1 | 4.02s | 756 | 10,896 | 0 |
| Programmierung | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| LongCat 2.0 | 10.0 | 10.0 | 100.0% | 0 | 455.00s | 7,419 | 533 | 214,143 | |
| Step 3.7 Flash | 8.2 | 7.2 | 88.9% | 1 | 9.46s | 7,437 | 18,685 | 0 |
| Kombiniert | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| LongCat 2.0 | 7.3 | 5.8 | 83.3% | 1 | 151.04s | 72,348 | 4,675 | 38,668 | |
| Step 3.7 Flash | 7.3 | 5.8 | 83.3% | 1 | 66.18s | 77,415 | 93,682 | 0 |
| Datenanalyse und -extraktion | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| LongCat 2.0 | 6.3 | 10.0 | 50.0% | 0 | 10.63s | 7,653 | 198 | 2,536 | |
| Step 3.7 Flash | 7.3 | 5.8 | 83.3% | 1 | 2.29s | 7,398 | 2,667 | 0 |
| Domänenspezifisch | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| LongCat 2.0 | 3.0 | 10.0 | 0.0% | 0 | 390.56s | 505 | 37,854 | 54,558 | |
| Step 3.7 Flash | 2.9 | 7.2 | 11.1% | 1 | 22.65s | 837 | 48,299 | 0 |
| Allgemeine Intelligenz | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| LongCat 2.0 | 4.8 | 3.2 | 33.3% | 1 | 16.35s | 480 | 121 | 1,598 | |
| Step 3.7 Flash | 3.4 | 9.3 | 0.0% | 0 | 7.00s | 525 | 4,604 | 0 |
| Befolgung von Anweisungen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| LongCat 2.0 | 6.5 | 10.0 | 50.0% | 0 | 7.38s | 657 | 78 | 1,652 | |
| Step 3.7 Flash | 9.8 | 10.0 | 100.0% | 0 | 1.58s | 735 | 1,857 | 0 |
| Rätsellösen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| LongCat 2.0 | 5.4 | 10.0 | 33.3% | 0 | 8.84s | 636 | 388 | 2,562 | |
| Step 3.7 Flash | 5.5 | 9.9 | 33.3% | 0 | 1.84s | 756 | 3,564 | 0 |
| Werkzeugaufrufe | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| LongCat 2.0 | 10.0 | 10.0 | 100.0% | 0 | 10.67s | 6,840 | 249 | 581 | |
| Step 3.7 Flash | 10.0 | 10.0 | 100.0% | 0 | 3.25s | 7,746 | 1,360 | 0 |
| Allgemeinwissen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| LongCat 2.0 | 3.0 | 10.0 | 0.0% | 0 | 191.19s | 198 | 86 | 25,780 | |
| Step 3.7 Flash | 3.0 | 10.0 | 0.0% | 0 | 124.75s | 237 | 134,779 | 0 |
Schnellvergleich
Vergleichspaar wechseln
Step 3.7 FlashlowvsGLM 5mediumQwen3.6 27BmediumvsStep 3.7 FlashlowLongCat 2.0mediumvsQwen3.7 FlashhighQwen3.7 FlashhighvsStep 3.7 FlashlowClaude Opus 5nonevsStep 3.7 FlashlowClaude Opus 4.8lowvsLongCat 2.0mediumClaude Opus 5nonevsLongCat 2.0mediumGemini 3.8 FlashlowvsLongCat 2.0mediumQwen3.8 27BmediumKostenlos verfügbarvsStep 3.7 FlashlowQwen3.5 Plus 2026-02-15mediumvsStep 3.7 FlashlowLongCat 2.0mediumvsQwen3.5-27BnoneQwen3.5-27BnonevsStep 3.7 Flashlow