- Rang
- #110
- Gesamte Ausgabe-Token
- 577,214
- Antwortzeit (Durchschnitt)
- 94.16s
- Gesamtkosten
- $0.462
DeepSeek V4 Flash 0731 (medium) vs Qwen3.7 Flash (low)
DeepSeek V4 Flash 0731 (medium) führt beim Durchschnittsscore mit 7.8 vs 7.7. Qwen3.7 Flash (low) hat die niedrigeren Benchmark-Kosten mit $0.053 vs $0.462. Qwen3.7 Flash (low) ist schneller mit 41.03s vs 94.16s, mit Erfolgsraten von 72.5% vs 68.1%.
Verglichene Modelle
- Rang
- #114
- Gesamte Ausgabe-Token
- 331,107
- Antwortzeit (Durchschnitt)
- 41.03s
- Gesamtkosten
- $0.053
Empfohlenes Modell
Qwen3.7 Flash (low)
Die Punktzahl bleibt nah an der besten hier (7.7 vs 7.8) und es kostet etwa 8.8x weniger als DeepSeek V4 Flash 0731 (medium).
Detaillierter Vergleich
| Metrik | DeepSeek V4 Flash 0731 DeepSeek V4 Flash 0731 medium | Qwen3.7 Flash Qwen3.7 Flash low |
|---|---|---|
| Punktzahl | 7.8 | 7.7 |
| Rang | #110 | #114 |
| Zuverlässigkeit | 10.0 | 10.0 |
| Konsistenz | 7.2 | 8.1 |
| Versuche | 69/69 | 69/69 |
| Korrekte Tests | ||
| Erfolgsquote pro Versuch | 72.5% | 68.1% |
| Instabile Tests | 8 | 6 |
| Gesamtläufe | 69 | 69 |
| Kosten pro Ergebnis | 1.176 | 0.439 |
| Gesamtkosten | $0.462 | $0.053 |
| Eingabepreis | $0.010 / 1M | $0.030 / 1M |
| Ausgabepreis | $1.280 / 1M | $0.130 / 1M |
| Gesamte Eingabe-Token | 274,189 | 318,058 |
| Ausgabe-Token | 66,689 | 16,035 |
| Denk-Token | 510,525 | 315,072 |
| Antwortzeit (Durchschnitt) | 94.16s | 41.03s |
| Antwortzeit (Maximum) | 303.26s | 394.54s |
| Antwortzeit (Gesamt) | 2165.72s | 943.75s |
| Parameter | 284B insgesamt (13B aktiv) | ~35B insgesamt (~3B aktiv) |
| Verfügbarkeit | Geschlossen | Geschlossen |
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#110 DeepSeek V4 Flash 0731
medium- Kosten
- $0.004
- Zeit
- 93.3s
- Token
- 13,252 tok
#114 Qwen3.7 Flash
low
Reached the allocated time limit (600 seconds) without receiving showcase output.
- Kosten
- $0.000
- Zeit
- 600.0s
- Token
- 0 tok
Top-Modelle nach Score
Score vs. Gesamtkosten
Antwortzeit (Durchschnitt)
Punktzahl vs Antwortzeit (Durchschnitt)
Gesamte Ausgabe-Token
Punktzahl vs Gesamte Ausgabe-Token
Kategorieaufschlüsselung
| Agentenaufgaben | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 10.0 | 10.0 | 100.0% | 0 | 303.26s | 184,370 | 8,291 | 18,068 | |
| Qwen3.7 Flash | 10.0 | 10.0 | 100.0% | 0 | 106.71s | 225,867 | 1,749 | 25,339 |
| Anti-KI-Tricks | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 8.2 | 7.9 | 83.3% | 1 | 17.95s | 698 | 2,101 | 6,715 | |
| Qwen3.7 Flash | 10.0 | 10.0 | 100.0% | 0 | 10.29s | 672 | 680 | 14,285 |
| Programmierung | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 6.4 | 4.4 | 77.8% | 2 | 198.78s | 6,032 | 4,109 | 160,154 | |
| Qwen3.7 Flash | 6.7 | 7.8 | 55.6% | 1 | 42.36s | 7,893 | 428 | 56,419 |
| Kombiniert | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 7.3 | 5.8 | 83.3% | 1 | 150.58s | 65,118 | 40,110 | 97,296 | |
| Qwen3.7 Flash | 6.4 | 5.8 | 66.7% | 1 | 217.77s | 64,756 | 11,880 | 131,432 |
| Datenanalyse und -extraktion | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 10.0 | 10.0 | 100.0% | 0 | 5.21s | 7,290 | 287 | 1,519 | |
| Qwen3.7 Flash | 10.0 | 10.0 | 100.0% | 0 | 15.44s | 7,782 | 270 | 12,503 |
| Domänenspezifisch | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 2.9 | 7.2 | 11.1% | 1 | 203.11s | 592 | 9,333 | 154,069 | |
| Qwen3.7 Flash | 3.6 | 7.2 | 22.2% | 1 | 37.60s | 780 | 60 | 38,897 |
| Allgemeine Intelligenz | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 6.1 | 3.1 | 66.7% | 1 | 12.16s | 471 | 66 | 1,589 | |
| Qwen3.7 Flash | 4.0 | 9.3 | 0.0% | 0 | 14.37s | 516 | 128 | 5,423 |
| Befolgung von Anweisungen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 8.5 | 6.8 | 83.3% | 1 | 2.42s | 706 | 109 | 580 | |
| Qwen3.7 Flash | 8.5 | 6.8 | 83.3% | 1 | 9.88s | 699 | 99 | 8,147 |
| Rätsellösen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 8.2 | 7.3 | 88.9% | 1 | 65.12s | 594 | 1,530 | 66,970 | |
| Qwen3.7 Flash | 7.3 | 5.2 | 77.8% | 2 | 9.79s | 696 | 382 | 10,763 |
| Werkzeugaufrufe | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 10.0 | 10.0 | 100.0% | 0 | 4.41s | 8,178 | 374 | 152 | |
| Qwen3.7 Flash | 10.0 | 10.0 | 100.0% | 0 | 7.66s | 8,193 | 335 | 2,172 |
| Allgemeinwissen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 3.0 | 10.0 | 0.0% | 0 | 56.64s | 140 | 379 | 3,413 | |
| Qwen3.7 Flash | 3.0 | 10.0 | 0.0% | 0 | 18.42s | 204 | 24 | 9,692 |
Schnellvergleich
Vergleichspaar wechseln
DeepSeek V4 Flash 0731mediumvsGrok 4.5lowMuse Glimmer 30BmediumvsQwen3.7 FlashlowDeepSeek V4 Flash 0731mediumvsQwen3.7 PlusnoneMuse Glimmer 30BhighvsQwen3.7 FlashlowGPT-6 LunahighvsQwen3.7 FlashlowDeepSeek V4 Flash 0731mediumvsGLM 5.3highDeepSeek V4 Flash 0731mediumvsGPT-6 LunahighDeepSeek V4 Flash 0731mediumvsMuse Glimmer 30BhighDeepSeek V4 Flash 0731mediumvsQwen3.8 2.4T A95BhighQwen3.7 FlashlowvsGrok 4.6mediumQwen3.7 FlashlowvsStep 3.7 FlashmediumDeepSeek V4 Flash 0731mediumvsQwen3.7 Maxnone