- Rang
- #41
- Gesamte Ausgabe-Token
- 49,721
- Antwortzeit (Durchschnitt)
- 4.92s
- Gesamtkosten
- $0.251
Gemini 3.6 Flash (low) vs Qwen3.8 Max (0902) (medium)
Qwen3.8 Max (0902) (medium) führt beim Durchschnittsscore mit 8.8 vs 8.7. Gemini 3.6 Flash (low) hat die niedrigeren Benchmark-Kosten mit $0.251 vs $0.677. Gemini 3.6 Flash (low) ist schneller mit 4.92s vs 26.01s, mit Erfolgsraten von 89.4% vs 83.3%.
- Rang
- #36
- Gesamte Ausgabe-Token
- 80,678
- Antwortzeit (Durchschnitt)
- 26.01s
- Gesamtkosten
- $0.677
Empfohlenes Modell
Gemini 3.6 Flash (low)
Die Punktzahl bleibt nah an der besten hier (8.7 vs 8.8) und es kostet etwa 2.7x weniger als Qwen3.8 Max (0902) (medium).
Detaillierter Vergleich
| Metrik | Gemini 3.6 Flash Gemini 3.6 Flash low | Qwen3.8 Max (0902) Qwen3.8 Max (0902) medium |
|---|---|---|
| Punktzahl | 8.7 | 8.8 |
| Rang | #41 | #36 |
| Zuverlässigkeit | 10.0 | 10.0 |
| Konsistenz | 8.9 | 9.3 |
| Versuche | 66/66 | 66/66 |
| Korrekte Tests | ||
| Erfolgsquote pro Versuch | 89.4% | 83.3% |
| Instabile Tests | 3 | 2 |
| Gesamtläufe | 66 | 66 |
| Kosten pro Ergebnis | 2.752 | 3.981 |
| Gesamtkosten | $0.251 | $0.677 |
| Eingabepreis | $0.750 / 1M | $2.000 / 1M |
| Ausgabepreis | $3.750 / 1M | $6.000 / 1M |
| Gesamte Eingabe-Token | 85,886 | 96,323 |
| Ausgabe-Token | 5,489 | 5,961 |
| Denk-Token | 44,232 | 74,717 |
| Antwortzeit (Durchschnitt) | 4.92s | 26.01s |
| Antwortzeit (Maximum) | 30.83s | 168.09s |
| Antwortzeit (Gesamt) | 108.28s | 572.19s |
| Parameter | ~500B insgesamt (~20B aktiv) | 2.4T insgesamt (~100B aktiv) |
| Verfügbarkeit | Geschlossen | Geschlossen |
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#41 Gemini 3.6 Flash
low- Kosten
- $0.045
- Zeit
- 25.0s
- Token
- 6,054 tok
#36 Qwen3.8 Max (0902)
medium- Kosten
- $0.036
- Zeit
- 108.3s
- Token
- 5,980 tok
Top-Modelle nach Score
Score vs. Gesamtkosten
Antwortzeit (Durchschnitt)
Punktzahl vs Antwortzeit (Durchschnitt)
Gesamte Ausgabe-Token
Punktzahl vs Gesamte Ausgabe-Token
Kategorieaufschlüsselung
| Anti-KI-Tricks | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.6 Flash | 8.7 | 7.9 | 91.7% | 1 | 1.85s | 508 | 165 | 2,334 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 5.03s | 672 | 295 | 2,003 |
| Programmierung | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.6 Flash | 7.8 | 10.0 | 66.7% | 0 | 6.95s | 8,126 | 466 | 12,253 | |
| Qwen3.8 Max (0902) | 8.4 | 7.4 | 88.9% | 1 | 45.74s | 7,893 | 551 | 20,628 |
| Kombiniert | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.6 Flash | 7.3 | 5.8 | 83.3% | 1 | 19.82s | 61,762 | 3,931 | 17,102 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 94.38s | 68,852 | 3,895 | 24,303 |
| Datenanalyse und -extraktion | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.6 Flash | 10.0 | 10.0 | 100.0% | 0 | 1.66s | 7,554 | 278 | 779 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 10.54s | 7,782 | 261 | 2,591 |
| Domänenspezifisch | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.6 Flash | 7.6 | 7.2 | 77.8% | 1 | 4.65s | 644 | 12 | 5,759 | |
| Qwen3.8 Max (0902) | 3.6 | 7.2 | 22.2% | 1 | 49.45s | 780 | 44 | 19,572 |
| Allgemeine Intelligenz | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.6 Flash | 10.0 | 10.0 | 100.0% | 0 | 3.02s | 490 | 109 | 1,062 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 7.56s | 516 | 202 | 689 |
| Befolgung von Anweisungen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.6 Flash | 9.8 | 10.0 | 100.0% | 0 | 2.82s | 623 | 72 | 1,871 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 4.24s | 699 | 90 | 886 |
| Rätsellösen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.6 Flash | 10.0 | 10.0 | 100.0% | 0 | 2.38s | 564 | 217 | 1,960 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 5.89s | 696 | 353 | 1,599 |
| Werkzeugaufrufe | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.6 Flash | 10.0 | 10.0 | 100.0% | 0 | 4.40s | 5,457 | 228 | 72 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 5.93s | 8,229 | 249 | 194 |
| Allgemeinwissen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.6 Flash | 10.0 | 10.0 | 100.0% | 0 | 2.94s | 158 | 11 | 1,040 | |
| Qwen3.8 Max (0902) | 3.0 | 10.0 | 0.0% | 0 | 17.01s | 204 | 21 | 2,252 |
Schnellvergleich
Vergleichspaar wechseln
Gemini 3.6 FlashlowvsGLM 5.3 FlashmaxClaude Opus 4.7mediumvsGemini 3.6 FlashlowGemini 3.5 FlashlowvsQwen3.8 Max (0902)mediumClaude Opus 4.8mediumvsGemini 3.6 FlashlowGemini 3.5 Flash LitehighvsQwen3.8 Max (0902)mediumGemini 3.6 FlashlowvsMuse Spark 1.3mediumGemini 3.6 FlashlowvsMuse Spark 1.2highClaude Opus 5lowvsQwen3.8 Max (0902)mediumQwen3.8 Max (0902)mediumvsGLM 5.3 FlashmaxGemini 3.6 FlashlowvsMuse Spark 1.2mediumGemini 3.6 FlashlowvsMuse Spark 1.1mediumClaude Fable 5mediumvsGemini 3.6 Flashlow