- Rang
- #137
- Gesamte Ausgabe-Token
- 246,790
- Antwortzeit (Durchschnitt)
- 57.41s
- Gesamtkosten
- $0.391
Qwen3.6 Plus (medium) vs Step 3.7 Flash (low)
Qwen3.6 Plus (medium) führt beim Durchschnittsscore mit 7.3 vs 7.2. Qwen3.6 Plus (medium) hat die niedrigeren Benchmark-Kosten mit $0.391 vs $0.449. Step 3.7 Flash (low) ist schneller mit 20.72s vs 57.41s, mit Erfolgsraten von 69.6% vs 63.8%.
Verglichene Modelle
- Rang
- #147
- Gesamte Ausgabe-Token
- 339,108
- Antwortzeit (Durchschnitt)
- 20.72s
- Gesamtkosten
- $0.449
Empfohlenes Modell
Step 3.7 Flash (low)
Die Punktzahl bleibt nah an der besten hier (7.2 vs 7.3) und es antwortet etwa 2.8x schneller als Qwen3.6 Plus (medium).
Detaillierter Vergleich
| Metrik | Qwen3.6 Plus Qwen3.6 Plus medium | Step 3.7 Flash Step 3.7 Flash low |
|---|---|---|
| Punktzahl | 7.3 | 7.2 |
| Rang | #137 | #147 |
| Zuverlässigkeit | 10.0 | 10.0 |
| Konsistenz | 9.0 | 7.9 |
| Versuche | 69/69 | 69/69 |
| Korrekte Tests | ||
| Erfolgsquote pro Versuch | 69.6% | 63.8% |
| Instabile Tests | 3 | 6 |
| Gesamtläufe | 69 | 69 |
| Kosten pro Ergebnis | 2.605 | 4.078 |
| Gesamtkosten | $0.391 | $0.449 |
| Eingabepreis | $0.325 / 1M | $0.200 / 1M |
| Ausgabepreis | $1.950 / 1M | $1.150 / 1M |
| Gesamte Eingabe-Token | 222,601 | 292,685 |
| Ausgabe-Token | 8,185 | 339,108 |
| Denk-Token | 238,605 | 0 |
| Antwortzeit (Durchschnitt) | 57.41s | 20.72s |
| Antwortzeit (Maximum) | 307.08s | 124.75s |
| Antwortzeit (Gesamt) | 1263.02s | 476.67s |
| Parameter | ~397B insgesamt (~17B aktiv) | 198B insgesamt (11B aktiv) |
| Verfügbarkeit | Geschlossen | Open Source |
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#137 Qwen3.6 Plus
medium- Kosten
- $0.024
- Zeit
- 219.0s
- Token
- 12,235 tok
#147 Step 3.7 Flash
low
Ungültiges SVG
- Kosten
- $0.004
- Zeit
- 25.3s
- Token
- 3,072 tok
Top-Modelle nach Score
Score vs. Gesamtkosten
Antwortzeit (Durchschnitt)
Punktzahl vs Antwortzeit (Durchschnitt)
Gesamte Ausgabe-Token
Punktzahl vs Gesamte Ausgabe-Token
Kategorieaufschlüsselung
| Agentenaufgaben | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.6 Plus | 4.7 | 3.1 | 33.3% | 1 | 307.08s | 124,903 | 1,768 | 47,390 | |
| Step 3.7 Flash | 7.4 | 3.8 | 66.7% | 1 | 83.63s | 188,843 | 18,715 | 0 |
| Anti-KI-Tricks | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.6 Plus | 10.0 | 10.0 | 100.0% | 0 | 9.90s | 672 | 207 | 7,557 | |
| Step 3.7 Flash | 8.7 | 7.9 | 91.7% | 1 | 4.02s | 756 | 10,896 | 0 |
| Programmierung | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.6 Plus | 6.1 | 7.8 | 44.4% | 1 | 153.12s | 7,098 | 58 | 50,586 | |
| Step 3.7 Flash | 8.2 | 7.2 | 88.9% | 1 | 9.46s | 7,437 | 18,685 | 0 |
| Kombiniert | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.6 Plus | 10.0 | 10.0 | 100.0% | 0 | 163.25s | 71,058 | 5,011 | 55,925 | |
| Step 3.7 Flash | 7.3 | 5.8 | 83.3% | 1 | 66.18s | 77,415 | 93,682 | 0 |
| Datenanalyse und -extraktion | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.6 Plus | 10.0 | 10.0 | 100.0% | 0 | 14.95s | 7,782 | 270 | 10,706 | |
| Step 3.7 Flash | 7.3 | 5.8 | 83.3% | 1 | 2.29s | 7,398 | 2,667 | 0 |
| Domänenspezifisch | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.6 Plus | 2.9 | 7.2 | 11.1% | 1 | 46.39s | 780 | 61 | 39,854 | |
| Step 3.7 Flash | 2.9 | 7.2 | 11.1% | 1 | 22.65s | 837 | 48,299 | 0 |
| Allgemeine Intelligenz | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.6 Plus | 5.1 | 10.0 | 0.0% | 0 | 27.05s | 516 | 111 | 5,232 | |
| Step 3.7 Flash | 3.4 | 9.3 | 0.0% | 0 | 7.00s | 525 | 4,604 | 0 |
| Befolgung von Anweisungen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.6 Plus | 10.0 | 10.0 | 100.0% | 0 | 7.54s | 699 | 102 | 5,552 | |
| Step 3.7 Flash | 9.8 | 10.0 | 100.0% | 0 | 1.58s | 735 | 1,857 | 0 |
| Rätsellösen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.6 Plus | 10.0 | 10.0 | 100.0% | 0 | 6.34s | 696 | 309 | 6,712 | |
| Step 3.7 Flash | 5.5 | 9.9 | 33.3% | 0 | 1.84s | 756 | 3,564 | 0 |
| Werkzeugaufrufe | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.6 Plus | 10.0 | 10.0 | 100.0% | 0 | 5.87s | 8,193 | 267 | 1,330 | |
| Step 3.7 Flash | 10.0 | 10.0 | 100.0% | 0 | 3.25s | 7,746 | 1,360 | 0 |
| Allgemeinwissen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.6 Plus | 3.0 | 10.0 | 0.0% | 0 | 47.51s | 204 | 21 | 7,761 | |
| Step 3.7 Flash | 3.0 | 10.0 | 0.0% | 0 | 124.75s | 237 | 134,779 | 0 |
Schnellvergleich
Vergleichspaar wechseln
Step 3.7 FlashlowvsGLM 5mediumLongCat 2.0highvsQwen3.6 PlusmediumLongCat 2.0mediumvsStep 3.7 FlashlowQwen3.6 27BmediumvsStep 3.7 FlashlowQwen3.7 FlashhighvsStep 3.7 FlashlowClaude Opus 5nonevsStep 3.7 FlashlowQwen3.8 27BmediumKostenlos verfügbarvsStep 3.7 FlashlowQwen3.6 PlusmediumvsGLM 5.3 FlashhighQwen3.5 Plus 2026-02-15mediumvsStep 3.7 FlashlowGemini 3.8 FlashlowvsQwen3.6 PlusmediumClaude Opus 4.8lowvsQwen3.6 PlusmediumQwen3.5-27BnonevsStep 3.7 Flashlow