- Rang
- #63
- Gesamte Ausgabe-Token
- 88,923
- Antwortzeit (Durchschnitt)
- 29.07s
- Gesamtkosten
- $1.131
Qwen3.8 Max (0902) (low) vs Grok 4.6 (high)
Der Durchschnittsscore ist mit 8.6 vs 8.5 praktisch gleichauf. Qwen3.8 Max (0902) (low) hat die niedrigeren Benchmark-Kosten mit $1.131 vs $2.629. Qwen3.8 Max (0902) (low) ist schneller mit 29.07s vs 87.48s, mit Erfolgsraten von 85.5% vs 82.6%.
Verglichene Modelle
- Rang
- #64
- Gesamte Ausgabe-Token
- 312,614
- Antwortzeit (Durchschnitt)
- 87.48s
- Gesamtkosten
- $2.629
Empfohlenes Modell
Qwen3.8 Max (0902) (low)
Es hat hier die beste Punktzahl (8.6) und kostet etwa 2.3x weniger als Grok 4.6 (high).
Detaillierter Vergleich
| Metrik | Qwen3.8 Max (0902) Qwen3.8 Max (0902) low | Grok 4.6 Grok 4.6 high |
|---|---|---|
| Punktzahl | 8.6 | 8.5 |
| Rang | #63 | #64 |
| Zuverlässigkeit | 10.0 | 10.0 |
| Konsistenz | 9.0 | 10.0 |
| Versuche | 69/69 | 69/69 |
| Korrekte Tests | ||
| Erfolgsquote pro Versuch | 85.5% | 82.6% |
| Instabile Tests | 3 | 0 |
| Gesamtläufe | 69 | 69 |
| Kosten pro Ergebnis | 6.283 | 13.833 |
| Gesamtkosten | $1.131 | $2.629 |
| Eingabepreis | $2.000 / 1M | $2.000 / 1M |
| Ausgabepreis | $6.000 / 1M | $6.000 / 1M |
| Gesamte Eingabe-Token | 298,682 | 376,233 |
| Ausgabe-Token | 8,374 | 6,687 |
| Denk-Token | 80,549 | 305,927 |
| Antwortzeit (Durchschnitt) | 29.07s | 87.48s |
| Antwortzeit (Maximum) | 207.79s | 618.49s |
| Antwortzeit (Gesamt) | 668.66s | 2012.15s |
| Parameter | 2.4T insgesamt (~100B aktiv) | ~1.7T insgesamt (~170B aktiv) |
| Verfügbarkeit | Geschlossen | Geschlossen |
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#63 Qwen3.8 Max (0902)
low- Kosten
- $0.014
- Zeit
- 41.2s
- Token
- 2,421 tok
#64 SpaceXAI: Grok 4.6
high- Kosten
- $0.107
- Zeit
- 265.1s
- Token
- 18,001 tok
Top-Modelle nach Score
Score vs. Gesamtkosten
Antwortzeit (Durchschnitt)
Punktzahl vs Antwortzeit (Durchschnitt)
Gesamte Ausgabe-Token
Punktzahl vs Gesamte Ausgabe-Token
Kategorieaufschlüsselung
| Agentenaufgaben | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 Max (0902) | 6.1 | 3.1 | 66.7% | 1 | 136.04s | 194,728 | 2,052 | 11,006 | |
| Grok 4.6 | 5.0 | 10.0 | 0.0% | 0 | 160.89s | 268,958 | 1,593 | 28,804 |
| Anti-KI-Tricks | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 4.72s | 984 | 212 | 1,854 | |
| Grok 4.6 | 10.0 | 10.0 | 100.0% | 0 | 14.44s | 2,991 | 79 | 6,805 |
| Programmierung | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 37.42s | 8,127 | 485 | 17,404 | |
| Grok 4.6 | 10.0 | 10.0 | 100.0% | 0 | 102.20s | 9,579 | 379 | 51,829 |
| Kombiniert | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 113.88s | 74,767 | 4,562 | 29,335 | |
| Grok 4.6 | 10.0 | 10.0 | 100.0% | 0 | 91.77s | 68,548 | 3,931 | 34,529 |
| Datenanalyse und -extraktion | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 9.94s | 7,938 | 261 | 2,254 | |
| Grok 4.6 | 10.0 | 10.0 | 100.0% | 0 | 16.08s | 8,937 | 225 | 6,590 |
| Domänenspezifisch | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 Max (0902) | 5.3 | 7.2 | 44.4% | 1 | 34.93s | 1,014 | 45 | 13,881 | |
| Grok 4.6 | 5.3 | 10.0 | 33.3% | 0 | 369.95s | 2,523 | 14 | 154,471 |
| Allgemeine Intelligenz | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 Max (0902) | 6.1 | 3.1 | 66.7% | 1 | 8.91s | 594 | 120 | 820 | |
| Grok 4.6 | 10.0 | 10.0 | 100.0% | 0 | 19.51s | 1,077 | 56 | 2,448 |
| Befolgung von Anweisungen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 4.32s | 855 | 90 | 866 | |
| Grok 4.6 | 9.8 | 10.0 | 100.0% | 0 | 13.82s | 1,857 | 57 | 4,318 |
| Rätsellösen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 4.49s | 930 | 275 | 1,248 | |
| Grok 4.6 | 10.0 | 10.0 | 100.0% | 0 | 15.56s | 2,430 | 122 | 5,706 |
| Werkzeugaufrufe | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 4.73s | 8,463 | 249 | 126 | |
| Grok 4.6 | 10.0 | 10.0 | 100.0% | 0 | 13.30s | 8,544 | 216 | 1,505 |
| Allgemeinwissen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 Max (0902) | 3.0 | 10.0 | 0.0% | 0 | 13.28s | 282 | 23 | 1,755 | |
| Grok 4.6 | 3.0 | 10.0 | 0.0% | 0 | 54.22s | 789 | 15 | 8,922 |
Schnellvergleich
Vergleichspaar wechseln
Muse Spark 1.3lowvsGrok 4.6highClaude Sonnet 5mediumvsGrok 4.6highQwen3.7 MaxmediumvsGrok 4.6highClaude Sonnet 5.5highvsQwen3.8 Max (0902)lowClaude Sonnet 5.5xhighvsQwen3.8 Max (0902)lowClaude Sonnet 5mediumvsQwen3.8 Max (0902)lowDeepSeek V4.1 FlashmaxvsQwen3.8 Max (0902)lowClaude Sonnet 5.5xhighvsGrok 4.6highMuse Spark 1.1lowvsGrok 4.6highDeepSeek V4.1 FlashmaxvsGrok 4.6highSeed 2.1 TurbomediumvsQwen3.8 Max (0902)lowQwen3.8 Max (0902)lowvsMiMo-V2.6-Promedium