Navigation
Advertise here

Qwen3.6 35B A3B (medium) vs Step 3.7 Flash (high)

Step 3.7 Flash (high) führt beim Durchschnittsscore mit 6.6 vs 6.5. Qwen3.6 35B A3B (medium) hat die niedrigeren Benchmark-Kosten mit $0.812 vs $1.350. Qwen3.6 35B A3B (medium) ist schneller mit 59.92s vs 72.72s, mit Erfolgsraten von 58.0% vs 58.0%.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-10-01

Verglichene Modelle

Rang
#193
Gesamte Ausgabe-Token
776,174
Antwortzeit (Durchschnitt)
59.92s
Gesamtkosten
$0.812
Rang
#190
Gesamte Ausgabe-Token
1,100,052
Antwortzeit (Durchschnitt)
72.72s
Gesamtkosten
$1.350
Empfohlenes Modell Qwen3.6 35B A3B (medium)

Die Punktzahl bleibt nah an der besten hier (6.5 vs 6.6) und es kostet etwa 1.7x weniger als Step 3.7 Flash (high).

Detaillierter Vergleich

Metrik Qwen3.6 35B A3B Qwen3.6 35B A3B medium Veröffentlichung: 2026-04-20 Step 3.7 Flash Step 3.7 Flash high Veröffentlichung: 2026-05-29
Punktzahl 6.5 6.6
Rang #193 #190
Zuverlässigkeit 10.0 10.0
Konsistenz 9.0 8.5
Versuche 69/69 69/69
Korrekte Tests
Erfolgsquote pro Versuch 58.0% 58.0%
Instabile Tests 3 4
Gesamtläufe 69 69
Kosten pro Ergebnis 6.732 12.267
Gesamtkosten $0.812 $1.350
Eingabepreis $0.150 / 1M $0.200 / 1M
Ausgabepreis $1.000 / 1M $1.150 / 1M
Gesamte Eingabe-Token 282,192 421,200
Ausgabe-Token 75,306 1,100,052
Denk-Token 700,868 0
Antwortzeit (Durchschnitt) 59.92s 72.72s
Antwortzeit (Maximum) 817.57s 364.99s
Antwortzeit (Gesamt) 1258.32s 1672.53s
Parameter 35B insgesamt (3B aktiv) 198B insgesamt (11B aktiv)
Verfügbarkeit Open Source Open Source

Modell-Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#193 Qwen3.6 35B A3B

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
Kosten
$0.000
Zeit
300.0s
Token
0 tok

#190 Step 3.7 Flash

high
Kosten
$0.007
Zeit
63.6s
Token
6,030 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Qwen3.6 35B A3B 7.7 10.0 66.7% 0 50.55s 5,051 7,929 37,223
Step 3.7 Flash 4.0 6.0 22.2% 1 206.21s 6,057 327,340 0

Schnellvergleich

Vergleichspaar wechseln