- Rang
- #30
- Gesamte Ausgabe-Token
- 27,194
- Antwortzeit (Durchschnitt)
- 24.18s
- Gesamtkosten
- $1.080
Claude Opus 5.5 (medium) vs Qwen3.8 Max (0902) (high)
Claude Opus 5.5 (medium) führt beim Durchschnittsscore mit 9.0 vs 8.9. Claude Opus 5.5 (medium) hat die niedrigeren Benchmark-Kosten mit $1.080 vs $2.736. Claude Opus 5.5 (medium) ist schneller mit 24.18s vs 185.56s, mit Erfolgsraten von 89.4% vs 86.4%.
Verglichene Modelle
- Rang
- #36
- Gesamte Ausgabe-Token
- 419,443
- Antwortzeit (Durchschnitt)
- 185.56s
- Gesamtkosten
- $2.736
Empfohlenes Modell
Claude Opus 5.5 (medium)
Es hat hier die beste Punktzahl (9.0) und kostet etwa 2.5x weniger als Qwen3.8 Max (0902) (high).
Detaillierter Vergleich
| Metrik | Claude Opus 5.5 Claude Opus 5.5 medium | Qwen3.8 Max (0902) Qwen3.8 Max (0902) high |
|---|---|---|
| Punktzahl | 9.0 | 8.9 |
| Rang | #30 | #36 |
| Zuverlässigkeit | 10.0 | 9.8 |
| Konsistenz | 9.6 | 9.0 |
| Versuche | 66/66 | 66/66 |
| Korrekte Tests | ||
| Erfolgsquote pro Versuch | 89.4% | 86.4% |
| Instabile Tests | 1 | 3 |
| Gesamtläufe | 66 | 66 |
| Kosten pro Ergebnis | 5.683 | 16.089 |
| Gesamtkosten | $1.080 | $2.736 |
| Eingabepreis | $4.000 / 1M | $2.000 / 1M |
| Ausgabepreis | $20.000 / 1M | $6.000 / 1M |
| Gesamte Eingabe-Token | 133,954 | 109,226 |
| Ausgabe-Token | 7,292 | 6,890 |
| Denk-Token | 19,902 | 412,553 |
| Antwortzeit (Durchschnitt) | 24.18s | 185.56s |
| Antwortzeit (Maximum) | 90.20s | 912.78s |
| Antwortzeit (Gesamt) | 532.04s | 4082.41s |
| Parameter | ~5T insgesamt (~500B aktiv) | 2.4T insgesamt (~100B aktiv) |
| Verfügbarkeit | Geschlossen | Geschlossen |
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#30 Claude Opus 5.5
medium- Kosten
- $0.053
- Zeit
- 25.6s
- Token
- 2,781 tok
#36 Qwen3.8 Max (0902)
high
Reached the allocated time limit (600 seconds) without receiving showcase output.
- Kosten
- $0.000
- Zeit
- 600.0s
- Token
- 0 tok
Top-Modelle nach Score
Score vs. Gesamtkosten
Antwortzeit (Durchschnitt)
Punktzahl vs Antwortzeit (Durchschnitt)
Gesamte Ausgabe-Token
Punktzahl vs Gesamte Ausgabe-Token
Kategorieaufschlüsselung
| Anti-KI-Tricks | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5.5 | 10.0 | 10.0 | 100.0% | 0 | 12.42s | 858 | 321 | 657 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 15.86s | 1,128 | 263 | 6,631 |
| Programmierung | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5.5 | 8.4 | 7.4 | 88.9% | 1 | 13.50s | 10,608 | 636 | 4,341 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 253.22s | 8,235 | 418 | 91,734 |
| Kombiniert | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5.5 | 10.0 | 10.0 | 100.0% | 0 | 55.69s | 96,679 | 4,639 | 4,527 | |
| Qwen3.8 Max (0902) | 8.7 | 6.9 | 83.3% | 1 | 110.39s | 79,527 | 5,215 | 28,102 |
| Datenanalyse und -extraktion | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5.5 | 10.0 | 10.0 | 100.0% | 0 | 12.65s | 10,515 | 312 | 277 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 16.37s | 8,010 | 261 | 3,598 |
| Domänenspezifisch | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5.5 | 7.7 | 10.0 | 66.7% | 0 | 21.35s | 990 | 61 | 8,360 | |
| Qwen3.8 Max (0902) | 5.9 | 7.2 | 55.6% | 1 | 658.46s | 842 | 31 | 154,450 |
| Allgemeine Intelligenz | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5.5 | 10.0 | 10.0 | 100.0% | 0 | 6.17s | 714 | 273 | 326 | |
| Qwen3.8 Max (0902) | 6.5 | 3.4 | 66.7% | 1 | 75.11s | 630 | 80 | 8,110 |
| Befolgung von Anweisungen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5.5 | 10.0 | 10.0 | 100.0% | 0 | 21.33s | 921 | 96 | 336 | |
| Qwen3.8 Max (0902) | 9.8 | 10.0 | 100.0% | 0 | 7.55s | 927 | 86 | 1,823 |
| Rätsellösen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5.5 | 10.0 | 10.0 | 100.0% | 0 | 30.12s | 912 | 513 | 491 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 134.14s | 1,038 | 268 | 47,351 |
| Werkzeugaufrufe | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5.5 | 10.0 | 10.0 | 100.0% | 0 | 74.20s | 11,757 | 441 | 587 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 5.21s | 8,571 | 249 | 243 |
| Allgemeinwissen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5.5 | 3.0 | 10.0 | 0.0% | 0 | 27.75s | 0 | 0 | 0 | |
| Qwen3.8 Max (0902) | 3.0 | 10.0 | 0.0% | 0 | 532.59s | 318 | 19 | 70,511 |
Schnellvergleich
Vergleichspaar wechseln
GPT-5.3-CodexmediumvsQwen3.8 Max (0902)highQwen3.8 Max (0902)highvsParetononeClaude Opus 5.5mediumvsGrok 4.5highGPT-5.5mediumvsQwen3.8 Max (0902)highGemini 3.5 FlashmediumvsQwen3.8 Max (0902)highClaude Opus 5.5mediumvsSeed 2.1 TurbolowClaude Opus 5.5mediumvsMuse Spark 1.3highClaude Opus 5.5mediumvsQwen3.8 Max (0902)lowClaude Opus 5.5mediumvsParetononeClaude Opus 5.5mediumvsSeed 2.1 TurbohighGemini 3.5 FlashlowvsQwen3.8 Max (0902)highSeed 2.1 TurbolowvsQwen3.8 Max (0902)high