- Rang
- #39
- Gesamte Ausgabe-Token
- 51,927
- Antwortzeit (Durchschnitt)
- 12.97s
- Gesamtkosten
- $1.983
Claude Opus 4.8 (medium) vs Qwen3.8 Max (0902) (medium)
Der Durchschnittsscore ist mit 8.8 vs 8.8 praktisch gleichauf. Qwen3.8 Max (0902) (medium) hat die niedrigeren Benchmark-Kosten mit $0.677 vs $1.983. Claude Opus 4.8 (medium) ist schneller mit 12.97s vs 26.01s, mit Erfolgsraten von 83.3% vs 83.3%.
- Rang
- #36
- Gesamte Ausgabe-Token
- 80,678
- Antwortzeit (Durchschnitt)
- 26.01s
- Gesamtkosten
- $0.677
Empfohlenes Modell
Qwen3.8 Max (0902) (medium)
Es hat hier die beste Punktzahl (8.8) und kostet etwa 2.9x weniger als Claude Opus 4.8 (medium).
Detaillierter Vergleich
| Metrik | Claude Opus 4.8 Claude Opus 4.8 medium | Qwen3.8 Max (0902) Qwen3.8 Max (0902) medium |
|---|---|---|
| Punktzahl | 8.8 | 8.8 |
| Rang | #39 | #36 |
| Zuverlässigkeit | 10.0 | 10.0 |
| Konsistenz | 9.2 | 9.3 |
| Versuche | 66/66 | 66/66 |
| Korrekte Tests | ||
| Erfolgsquote pro Versuch | 83.3% | 83.3% |
| Instabile Tests | 2 | 2 |
| Gesamtläufe | 66 | 66 |
| Kosten pro Ergebnis | 11.662 | 3.981 |
| Gesamtkosten | $1.983 | $0.677 |
| Eingabepreis | $5.000 / 1M | $2.000 / 1M |
| Ausgabepreis | $25.000 / 1M | $6.000 / 1M |
| Gesamte Eingabe-Token | 138,448 | 96,323 |
| Ausgabe-Token | 40,765 | 5,961 |
| Denk-Token | 11,162 | 74,717 |
| Antwortzeit (Durchschnitt) | 12.97s | 26.01s |
| Antwortzeit (Maximum) | 70.54s | 168.09s |
| Antwortzeit (Gesamt) | 285.29s | 572.19s |
| Parameter | ~5T insgesamt (~500B aktiv) | 2.4T insgesamt (~100B aktiv) |
| Verfügbarkeit | Geschlossen | Geschlossen |
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#39 Claude Opus 4.8
medium- Kosten
- $0.057
- Zeit
- 23.1s
- Token
- 2,412 tok
#36 Qwen3.8 Max (0902)
medium- Kosten
- $0.036
- Zeit
- 108.3s
- Token
- 5,980 tok
Top-Modelle nach Score
Score vs. Gesamtkosten
Antwortzeit (Durchschnitt)
Punktzahl vs Antwortzeit (Durchschnitt)
Gesamte Ausgabe-Token
Punktzahl vs Gesamte Ausgabe-Token
Kategorieaufschlüsselung
| Anti-KI-Tricks | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 3.95s | 834 | 1,179 | 478 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 5.03s | 672 | 295 | 2,003 |
| Programmierung | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 15.33s | 10,590 | 9,945 | 1,381 | |
| Qwen3.8 Max (0902) | 8.4 | 7.4 | 88.9% | 1 | 45.74s | 7,893 | 551 | 20,628 |
| Kombiniert | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 9.9 | 10.0 | 100.0% | 0 | 54.29s | 101,005 | 19,531 | 4,762 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 94.38s | 68,852 | 3,895 | 24,303 |
| Datenanalyse und -extraktion | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 7.1 | 5.6 | 83.3% | 1 | 12.29s | 10,503 | 481 | 312 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 10.54s | 7,782 | 261 | 2,591 |
| Domänenspezifisch | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 3.6 | 7.2 | 22.2% | 1 | 18.11s | 972 | 7,476 | 2,987 | |
| Qwen3.8 Max (0902) | 3.6 | 7.2 | 22.2% | 1 | 49.45s | 780 | 44 | 19,572 |
| Allgemeine Intelligenz | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 2.46s | 708 | 237 | 0 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 7.56s | 516 | 202 | 689 |
| Befolgung von Anweisungen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 3.32s | 909 | 373 | 320 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 4.24s | 699 | 90 | 886 |
| Rätsellösen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 3.95s | 894 | 791 | 483 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 5.89s | 696 | 353 | 1,599 |
| Werkzeugaufrufe | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 8.96s | 11,775 | 301 | 225 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 5.93s | 8,229 | 249 | 194 |
| Allgemeinwissen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 3.0 | 10.0 | 0.0% | 0 | 6.14s | 258 | 451 | 214 | |
| Qwen3.8 Max (0902) | 3.0 | 10.0 | 0.0% | 0 | 17.01s | 204 | 21 | 2,252 |
Schnellvergleich
Vergleichspaar wechseln
Claude Opus 4.8mediumvsGemini 3.5 Flash LitehighGemini 3.5 FlashlowvsQwen3.8 Max (0902)mediumClaude Opus 4.8mediumvsGemini 3.6 FlashlowClaude Opus 4.8mediumvsGLM 5.3 FlashmaxGemini 3.5 Flash LitehighvsQwen3.8 Max (0902)mediumClaude Opus 4.8mediumvsGemini 3.5 FlashlowClaude Opus 5lowvsQwen3.8 Max (0902)mediumGemini 3.6 FlashlowvsQwen3.8 Max (0902)mediumQwen3.8 Max (0902)mediumvsGLM 5.3 FlashmaxClaude Opus 4.8mediumvsMuse Spark 1.2highSeed 2.1 TurbohighvsQwen3.8 Max (0902)mediumMuse Spark 1.3highvsQwen3.8 Max (0902)medium