Navigation
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Qwen: Qwen3.6 Max Preview vs Qwen: Qwen3.7 Plus

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-06-03

Metrik Qwen3.6 Max Preview Qwen3.6 Max Preview medium Veröffentlichung: 2026-04-20 Qwen3.7 Plus Qwen3.7 Plus medium Veröffentlichung: 2026-06-03
Punktzahl 8.4 8.4
Rang #15 #16
Zuverlässigkeit 10.0 9.9
Konsistenz 9.2 9.2
Korrekte Tests
Erfolgsquote pro Versuch 80.0% 80.0%
Instabile Tests 2 2
Gesamtläufe 60 60
Kosten pro Ergebnis 6.910 1.324
Gesamtkosten $0.872 $0.199
Eingabepreis $1.040 / 1M $0.400 / 1M
Ausgabepreis $6.240 / 1M $1.600 / 1M
Gesamte Eingabe-Token 39,527 38,104
Ausgabe-Token 2,253 2,107
Denk-Token 130,852 112,479
Antwortzeit (Durchschnitt) 58.43s 36.84s
Antwortzeit (Maximum) 238.07s 178.04s
Antwortzeit (Gesamt) 1168.66s 736.86s

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Anti-KI-Tricks Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Qwen3.6 Max Preview 10.0 10.0 100.0% 0 22.13s 672 228 10,075
Qwen3.7 Plus 10.0 10.0 100.0% 0 8.58s 672 195 5,065
Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Qwen3.6 Max Preview 8.2 6.7 83.3% 1 177.97s 5,060 407 39,442
Qwen3.7 Plus 6.5 5.9 66.7% 1 122.40s 3,637 396 30,301
Kombiniert Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Qwen3.6 Max Preview 10.0 10.0 100.0% 0 121.49s 14,934 390 14,575
Qwen3.7 Plus 10.0 10.0 100.0% 0 65.24s 14,934 366 10,132
Datenanalyse und -extraktion Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Qwen3.6 Max Preview 10.0 10.0 100.0% 0 41.15s 7,782 270 10,106
Qwen3.7 Plus 10.0 10.0 100.0% 0 21.75s 7,782 270 6,713
Domänenspezifisch Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Qwen3.6 Max Preview 2.9 7.2 11.1% 1 95.91s 771 60 30,371
Qwen3.7 Plus 3.6 7.2 22.2% 1 45.35s 771 57 27,073
Allgemeine Intelligenz Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Qwen3.6 Max Preview 10.0 10.0 100.0% 0 32.24s 516 129 3,510
Qwen3.7 Plus 10.0 10.0 100.0% 0 25.48s 516 123 3,998
Befolgung von Anweisungen Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Qwen3.6 Max Preview 10.0 10.0 100.0% 0 24.31s 699 103 5,848
Qwen3.7 Plus 10.0 10.0 100.0% 0 16.13s 699 102 5,013
Rätsellösen Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Qwen3.6 Max Preview 10.0 10.0 100.0% 0 24.32s 696 329 7,693
Qwen3.7 Plus 10.0 10.0 100.0% 0 16.38s 696 280 7,312
Werkzeugaufrufe Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Qwen3.6 Max Preview 10.0 10.0 100.0% 0 18.32s 8,193 309 1,571
Qwen3.7 Plus 10.0 10.0 100.0% 0 15.02s 8,193 292 1,831
Allgemeinwissen Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Qwen3.6 Max Preview 3.0 10.0 0.0% 0 60.56s 204 28 7,661
Qwen3.7 Plus 3.0 10.0 0.0% 0 91.07s 204 26 15,041

Schnellvergleich

Vergleichspaar wechseln