- Rang
- #66
- Gesamte Ausgabe-Token
- 73,261
- Antwortzeit (Durchschnitt)
- 15.01s
- Gesamtkosten
- $1.438
Claude Sonnet 5 (medium) vs Qwen3.8 Max (0902) (low)
Qwen3.8 Max (0902) (low) führt beim Durchschnittsscore mit 8.6 vs 8.5. Qwen3.8 Max (0902) (low) hat die niedrigeren Benchmark-Kosten mit $1.131 vs $1.438. Claude Sonnet 5 (medium) ist schneller mit 15.01s vs 29.07s, mit Erfolgsraten von 76.8% vs 85.5%.
Verglichene Modelle
- Rang
- #63
- Gesamte Ausgabe-Token
- 88,923
- Antwortzeit (Durchschnitt)
- 29.07s
- Gesamtkosten
- $1.131
Empfohlenes Modell
Claude Sonnet 5 (medium)
Die Punktzahl bleibt nah an der besten hier (8.5 vs 8.6) und es antwortet etwa 1.9x schneller als Qwen3.8 Max (0902) (low).
Detaillierter Vergleich
| Metrik | Claude Sonnet 5 Claude Sonnet 5 medium | Qwen3.8 Max (0902) Qwen3.8 Max (0902) low |
|---|---|---|
| Punktzahl | 8.5 | 8.6 |
| Rang | #66 | #63 |
| Zuverlässigkeit | 10.0 | 10.0 |
| Konsistenz | 9.1 | 9.0 |
| Versuche | 69/69 | 69/69 |
| Korrekte Tests | ||
| Erfolgsquote pro Versuch | 76.8% | 85.5% |
| Instabile Tests | 3 | 3 |
| Gesamtläufe | 69 | 69 |
| Kosten pro Ergebnis | 8.985 | 6.283 |
| Gesamtkosten | $1.438 | $1.131 |
| Eingabepreis | $2.000 / 1M | $2.000 / 1M |
| Ausgabepreis | $10.000 / 1M | $6.000 / 1M |
| Gesamte Eingabe-Token | 353,658 | 298,682 |
| Ausgabe-Token | 54,891 | 8,374 |
| Denk-Token | 18,370 | 80,549 |
| Antwortzeit (Durchschnitt) | 15.01s | 29.07s |
| Antwortzeit (Maximum) | 69.26s | 207.79s |
| Antwortzeit (Gesamt) | 345.16s | 668.66s |
| Parameter | ~1T insgesamt (~100B aktiv) | 2.4T insgesamt (~100B aktiv) |
| Verfügbarkeit | Geschlossen | Geschlossen |
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#66 Claude Sonnet 5
medium- Kosten
- $0.007
- Zeit
- 6.4s
- Token
- 832 tok
#63 Qwen3.8 Max (0902)
low- Kosten
- $0.014
- Zeit
- 41.2s
- Token
- 2,421 tok
Top-Modelle nach Score
Score vs. Gesamtkosten
Antwortzeit (Durchschnitt)
Punktzahl vs Antwortzeit (Durchschnitt)
Gesamte Ausgabe-Token
Punktzahl vs Gesamte Ausgabe-Token
Kategorieaufschlüsselung
| Agentenaufgaben | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5 | 10.0 | 10.0 | 100.0% | 0 | 69.26s | 207,705 | 2,561 | 7,496 | |
| Qwen3.8 Max (0902) | 6.1 | 3.1 | 66.7% | 1 | 136.04s | 194,728 | 2,052 | 11,006 |
| Anti-KI-Tricks | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5 | 10.0 | 10.0 | 100.0% | 0 | 3.80s | 834 | 1,220 | 446 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 4.72s | 984 | 212 | 1,854 |
| Programmierung | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5 | 9.0 | 7.9 | 88.9% | 1 | 17.28s | 10,590 | 13,153 | 2,379 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 37.42s | 8,127 | 485 | 17,404 |
| Kombiniert | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5 | 7.3 | 6.0 | 83.3% | 1 | 51.86s | 107,934 | 23,169 | 5,371 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 113.88s | 74,767 | 4,562 | 29,335 |
| Datenanalyse und -extraktion | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5 | 10.0 | 10.0 | 100.0% | 0 | 3.16s | 10,503 | 312 | 0 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 9.94s | 7,938 | 261 | 2,254 |
| Domänenspezifisch | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5 | 5.3 | 10.0 | 33.3% | 0 | 20.54s | 972 | 12,137 | 1,994 | |
| Qwen3.8 Max (0902) | 5.3 | 7.2 | 44.4% | 1 | 34.93s | 1,014 | 45 | 13,881 |
| Allgemeine Intelligenz | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5 | 4.8 | 3.2 | 33.3% | 1 | 4.32s | 708 | 264 | 0 | |
| Qwen3.8 Max (0902) | 6.1 | 3.1 | 66.7% | 1 | 8.91s | 594 | 120 | 820 |
| Befolgung von Anweisungen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5 | 9.9 | 10.0 | 100.0% | 0 | 3.10s | 909 | 318 | 269 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 4.32s | 855 | 90 | 866 |
| Rätsellösen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5 | 7.7 | 10.0 | 66.7% | 0 | 2.98s | 894 | 407 | 121 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 4.49s | 930 | 275 | 1,248 |
| Werkzeugaufrufe | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5 | 10.0 | 10.0 | 100.0% | 0 | 10.70s | 12,351 | 433 | 90 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 4.73s | 8,463 | 249 | 126 |
| Allgemeinwissen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5 | 3.0 | 10.0 | 0.0% | 0 | 7.06s | 258 | 917 | 204 | |
| Qwen3.8 Max (0902) | 3.0 | 10.0 | 0.0% | 0 | 13.28s | 282 | 23 | 1,755 |
Schnellvergleich
Vergleichspaar wechseln
Claude Sonnet 5mediumvsMuse Spark 1.3lowClaude Sonnet 5mediumvsGrok 4.6highQwen3.8 Max (0902)lowvsGrok 4.6highClaude Sonnet 5.5highvsQwen3.8 Max (0902)lowClaude Sonnet 5.5xhighvsQwen3.8 Max (0902)lowDeepSeek V4.1 FlashmaxvsQwen3.8 Max (0902)lowClaude Sonnet 5mediumvsQwen3.8 2.4T A95BlowClaude Sonnet 5mediumvsMuse Glimmer 30BxhighClaude Sonnet 5mediumvsMuse Spark 1.1lowSeed 2.1 TurbomediumvsQwen3.8 Max (0902)lowQwen3.8 Max (0902)lowvsMiMo-V2.6-PromediumGPT-5.2mediumvsQwen3.8 Max (0902)low