- Rang
- #67
- Gesamte Ausgabe-Token
- 259,032
- Antwortzeit (Durchschnitt)
- 48.35s
- Gesamtkosten
- $1.689
Qwen3.7 Max (medium) vs Qwen3.8 2.4T A95B (low)
Qwen3.7 Max (medium) führt beim Durchschnittsscore mit 8.5 vs 8.4. Qwen3.7 Max (medium) hat die niedrigeren Benchmark-Kosten mit $1.689 vs $4.016. Qwen3.7 Max (medium) ist schneller mit 48.35s vs 120.40s, mit Erfolgsraten von 85.5% vs 73.9%.
Verglichene Modelle
- Rang
- #68
- Gesamte Ausgabe-Token
- 512,034
- Antwortzeit (Durchschnitt)
- 120.40s
- Gesamtkosten
- $4.016
Empfohlenes Modell
Qwen3.7 Max (medium)
Es hat hier die beste Punktzahl (8.5) und kostet etwa 2.4x weniger als Qwen3.8 2.4T A95B (low).
Detaillierter Vergleich
| Metrik | Qwen3.7 Max Qwen3.7 Max medium | Qwen3.8 2.4T A95B Qwen3.8 2.4T A95B low |
|---|---|---|
| Punktzahl | 8.5 | 8.4 |
| Rang | #67 | #68 |
| Zuverlässigkeit | 10.0 | 9.6 |
| Konsistenz | 8.7 | 9.2 |
| Versuche | 69/69 | 69/69 |
| Korrekte Tests | ||
| Erfolgsquote pro Versuch | 85.5% | 73.9% |
| Instabile Tests | 4 | 2 |
| Gesamtläufe | 69 | 69 |
| Kosten pro Ergebnis | 12.033 | 19.825 |
| Gesamtkosten | $1.689 | $4.016 |
| Eingabepreis | $1.475 / 1M | $2.000 / 1M |
| Ausgabepreis | $4.425 / 1M | $6.000 / 1M |
| Preis für Cache-Lesen | $0.295 / 1M | $0.250 / 1M |
| Preis für Cache-Schreiben | $1.844 / 1M | k. A. |
| Gesamte Eingabe-Token | 367,848 | 313,881 |
| Ausgabe-Token | 8,753 | 123,706 |
| Denk-Token | 250,279 | 388,328 |
| Antwortzeit (Durchschnitt) | 48.35s | 120.40s |
| Antwortzeit (Maximum) | 556.06s | 534.21s |
| Antwortzeit (Gesamt) | 1112.11s | 2769.16s |
| Parameter | ~1T insgesamt (~40B aktiv) | 2.4T insgesamt (95B aktiv) |
| Verfügbarkeit | Geschlossen | Gewichte verfügbar |
Cache-Preise gelten für Eingabetokens. Lesen nutzt gespeicherte Prompts erneut; Schreiben speichert sie und kann mehr kosten. Für Ausgabetokens gilt der Ausgabepreis.
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#67 Qwen3.7 Max
medium- Kosten
- $0.017
- Zeit
- 68.8s
- Token
- 4,526 tok
#68 Qwen3.8 2.4T A95B
low- Kosten
- $0.100
- Zeit
- 193.2s
- Token
- 16,767 tok
Top-Modelle nach Score
Score vs. Gesamtkosten
Antwortzeit (Durchschnitt)
Punktzahl vs Antwortzeit (Durchschnitt)
Gesamte Ausgabe-Token
Punktzahl vs Gesamte Ausgabe-Token
Kategorieaufschlüsselung
| Agentenaufgaben | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.7 Max | 6.1 | 3.1 | 66.7% | 1 | 137.00s | 261,819 | 3,005 | 29,925 | |
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 151.76s | 200,602 | 2,661 | 13,832 |
| Anti-KI-Tricks | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 6.36s | 672 | 222 | 8,742 | |
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 22.04s | 1,104 | 397 | 4,814 |
| Programmierung | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 35.31s | 7,893 | 423 | 34,808 | |
| Qwen3.8 2.4T A95B | 7.8 | 9.3 | 66.7% | 0 | 172.53s | 6,716 | 21,405 | 57,399 |
| Kombiniert | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.7 Max | 8.7 | 6.9 | 83.3% | 1 | 287.83s | 78,594 | 3,985 | 96,450 | |
| Qwen3.8 2.4T A95B | 8.2 | 6.9 | 66.7% | 1 | 231.85s | 85,267 | 8,008 | 50,681 |
| Datenanalyse und -extraktion | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 8.80s | 7,782 | 270 | 6,254 | |
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 22.27s | 7,956 | 839 | 2,445 |
| Domänenspezifisch | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.7 Max | 4.1 | 4.4 | 44.5% | 2 | 52.45s | 780 | 61 | 41,143 | |
| Qwen3.8 2.4T A95B | 3.2 | 9.3 | 0.0% | 0 | 287.65s | 1,008 | 16,133 | 156,114 |
| Allgemeine Intelligenz | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 11.70s | 516 | 135 | 4,457 | |
| Qwen3.8 2.4T A95B | 6.1 | 3.1 | 66.7% | 1 | 22.97s | 606 | 44 | 1,497 |
| Befolgung von Anweisungen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 7.46s | 699 | 102 | 5,452 | |
| Qwen3.8 2.4T A95B | 9.8 | 10.0 | 100.0% | 0 | 19.54s | 903 | 263 | 1,480 |
| Rätsellösen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 8.84s | 696 | 259 | 8,908 | |
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 43.37s | 1,026 | 1,154 | 25,563 |
| Werkzeugaufrufe | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 6.63s | 8,193 | 267 | 1,220 | |
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 25.88s | 8,481 | 302 | 975 |
| Allgemeinwissen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.7 Max | 3.0 | 10.0 | 0.0% | 0 | 33.37s | 204 | 24 | 12,920 | |
| Qwen3.8 2.4T A95B | 3.0 | 10.0 | 0.0% | 0 | 422.46s | 212 | 72,500 | 73,528 |
Schnellvergleich
Vergleichspaar wechseln
Muse Spark 1.3lowvsQwen3.7 MaxmediumGPT-5 MinimediumvsQwen3.8 2.4T A95BlowMuse Glimmer 30BxhighvsQwen3.8 2.4T A95BlowGemini 3.1 Pro PreviewmediumvsQwen3.8 2.4T A95BlowQwen3.7 MaxmediumvsGrok 4.6highQwen3.8 2.4T A95BlowvsInklinghighKostenlos verfügbarMuse Spark 1.1highvsQwen3.8 2.4T A95BlowDeepSeek V4 Flash 0731highvsQwen3.8 2.4T A95BlowClaude Sonnet 5mediumvsQwen3.8 2.4T A95BlowQwen3.8 2.4T A95BlowvsGLM 5.2highMuse Glimmer 30BxhighvsQwen3.7 MaxmediumClaude Sonnet 5.5highvsQwen3.7 Maxmedium