- Rang
- #145
- Gesamte Ausgabe-Token
- 422,234
- Antwortzeit (Durchschnitt)
- 144.88s
- Gesamtkosten
- $0.593
LongCat 2.0 (medium) vs Qwen3.7 Flash (high)
Der Durchschnittsscore ist mit 7.2 vs 7.2 praktisch gleichauf. Qwen3.7 Flash (high) hat die niedrigeren Benchmark-Kosten mit $0.063 vs $0.593. Qwen3.7 Flash (high) ist schneller mit 45.48s vs 144.88s, mit Erfolgsraten von 59.4% vs 71.0%.
Verglichene Modelle
- Rang
- #144
- Gesamte Ausgabe-Token
- 409,818
- Antwortzeit (Durchschnitt)
- 45.48s
- Gesamtkosten
- $0.063
Empfohlenes Modell
Qwen3.7 Flash (high)
Es hat hier die beste Punktzahl (7.2) und kostet etwa 9.6x weniger als LongCat 2.0 (medium).
Detaillierter Vergleich
| Metrik | LongCat 2.0 LongCat 2.0 medium | Qwen3.7 Flash Qwen3.7 Flash high |
|---|---|---|
| Punktzahl | 7.2 | 7.2 |
| Rang | #145 | #144 |
| Zuverlässigkeit | 10.0 | 10.0 |
| Konsistenz | 9.0 | 7.6 |
| Versuche | 69/69 | 69/69 |
| Korrekte Tests | ||
| Erfolgsquote pro Versuch | 59.4% | 71.0% |
| Instabile Tests | 3 | 7 |
| Gesamtläufe | 69 | 69 |
| Kosten pro Ergebnis | 4.942 | 0.478 |
| Gesamtkosten | $0.593 | $0.063 |
| Eingabepreis | $0.300 / 1M | $0.030 / 1M |
| Ausgabepreis | $1.200 / 1M | $0.130 / 1M |
| Gesamte Eingabe-Token | 287,669 | 293,775 |
| Ausgabe-Token | 47,204 | 13,527 |
| Denk-Token | 375,030 | 396,291 |
| Antwortzeit (Durchschnitt) | 144.88s | 45.48s |
| Antwortzeit (Maximum) | 939.52s | 431.47s |
| Antwortzeit (Gesamt) | 3332.19s | 1045.97s |
| Parameter | 1.6T insgesamt (48B aktiv) | ~35B insgesamt (~3B aktiv) |
| Verfügbarkeit | Open Source | Geschlossen |
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#145 LongCat 2.0
medium- Kosten
- $0.016
- Zeit
- 285.1s
- Token
- 13,057 tok
#144 Qwen3.7 Flash
high
Reached the allocated time limit (600 seconds) without receiving showcase output.
- Kosten
- $0.000
- Zeit
- 600.0s
- Token
- 0 tok
Top-Modelle nach Score
Score vs. Gesamtkosten
Antwortzeit (Durchschnitt)
Punktzahl vs Antwortzeit (Durchschnitt)
Gesamte Ausgabe-Token
Punktzahl vs Gesamte Ausgabe-Token
Kategorieaufschlüsselung
| Agentenaufgaben | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| LongCat 2.0 | 6.1 | 3.1 | 66.7% | 1 | 174.08s | 190,345 | 2,821 | 28,540 | |
| Qwen3.7 Flash | 4.7 | 1.6 | 66.7% | 1 | 135.86s | 177,444 | 1,197 | 38,371 |
| Anti-KI-Tricks | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| LongCat 2.0 | 10.0 | 10.0 | 100.0% | 0 | 9.65s | 588 | 201 | 4,412 | |
| Qwen3.7 Flash | 10.0 | 10.0 | 100.0% | 0 | 10.21s | 672 | 713 | 13,968 |
| Programmierung | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| LongCat 2.0 | 10.0 | 10.0 | 100.0% | 0 | 455.00s | 7,419 | 533 | 214,143 | |
| Qwen3.7 Flash | 8.2 | 9.7 | 66.7% | 0 | 58.84s | 7,893 | 503 | 62,350 |
| Kombiniert | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| LongCat 2.0 | 7.3 | 5.8 | 83.3% | 1 | 151.04s | 72,348 | 4,675 | 38,668 | |
| Qwen3.7 Flash | 6.9 | 5.9 | 66.7% | 1 | 231.97s | 88,896 | 9,866 | 203,866 |
| Datenanalyse und -extraktion | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| LongCat 2.0 | 6.3 | 10.0 | 50.0% | 0 | 10.63s | 7,653 | 198 | 2,536 | |
| Qwen3.7 Flash | 10.0 | 10.0 | 100.0% | 0 | 20.10s | 7,782 | 270 | 10,800 |
| Domänenspezifisch | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| LongCat 2.0 | 3.0 | 10.0 | 0.0% | 0 | 390.56s | 505 | 37,854 | 54,558 | |
| Qwen3.7 Flash | 2.9 | 4.4 | 22.2% | 2 | 34.43s | 780 | 59 | 35,675 |
| Allgemeine Intelligenz | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| LongCat 2.0 | 4.8 | 3.2 | 33.3% | 1 | 16.35s | 480 | 121 | 1,598 | |
| Qwen3.7 Flash | 5.1 | 3.4 | 33.3% | 1 | 10.73s | 516 | 120 | 3,898 |
| Befolgung von Anweisungen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| LongCat 2.0 | 6.5 | 10.0 | 50.0% | 0 | 7.38s | 657 | 78 | 1,652 | |
| Qwen3.7 Flash | 9.8 | 10.0 | 100.0% | 0 | 9.41s | 699 | 97 | 7,838 |
| Rätsellösen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| LongCat 2.0 | 5.4 | 10.0 | 33.3% | 0 | 8.84s | 636 | 388 | 2,562 | |
| Qwen3.7 Flash | 7.1 | 5.1 | 77.8% | 2 | 10.79s | 696 | 369 | 10,474 |
| Werkzeugaufrufe | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| LongCat 2.0 | 10.0 | 10.0 | 100.0% | 0 | 10.67s | 6,840 | 249 | 581 | |
| Qwen3.7 Flash | 10.0 | 10.0 | 100.0% | 0 | 5.72s | 8,193 | 309 | 1,436 |
| Allgemeinwissen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| LongCat 2.0 | 3.0 | 10.0 | 0.0% | 0 | 191.19s | 198 | 86 | 25,780 | |
| Qwen3.7 Flash | 3.0 | 10.0 | 0.0% | 0 | 17.70s | 204 | 24 | 7,615 |
Schnellvergleich
Vergleichspaar wechseln
LongCat 2.0mediumvsStep 3.7 FlashlowClaude Opus 4.8lowvsQwen3.7 FlashhighQwen3.7 FlashhighvsGLM 5mediumGemini 3.8 FlashlowvsQwen3.7 FlashhighQwen3.7 FlashhighvsStep 3.7 FlashlowClaude Opus 4.8lowvsLongCat 2.0mediumClaude Opus 5nonevsLongCat 2.0mediumGemini 3.8 FlashlowvsLongCat 2.0mediumClaude Opus 5nonevsQwen3.7 FlashhighLongCat 2.0mediumvsQwen3.5-27BnoneGemini 3.5 Flash LitemediumvsQwen3.7 FlashhighGemini 2.5 FlashmediumvsQwen3.7 Flashhigh