- Rang
- #77
- Gesamte Ausgabe-Token
- 246,012
- Antwortzeit (Durchschnitt)
- 18.59s
- Gesamtkosten
- $2.737
Gemini 3.5 Flash (high) vs Qwen3.8 2.4T A95B (low)
Qwen3.8 2.4T A95B (low) führt beim Durchschnittsscore mit 8.4 vs 8.3. Gemini 3.5 Flash (high) hat die niedrigeren Benchmark-Kosten mit $2.737 vs $3.172. Gemini 3.5 Flash (high) ist schneller mit 18.59s vs 120.40s, mit Erfolgsraten von 85.5% vs 73.9%.
Verglichene Modelle
- Rang
- #68
- Gesamte Ausgabe-Token
- 512,034
- Antwortzeit (Durchschnitt)
- 120.40s
- Gesamtkosten
- $3.172
Empfohlenes Modell
Gemini 3.5 Flash (high)
Die Punktzahl bleibt nah an der besten hier (8.3 vs 8.4) und es antwortet etwa 6.5x schneller als Qwen3.8 2.4T A95B (low).
Detaillierter Vergleich
| Metrik | Gemini 3.5 Flash Gemini 3.5 Flash high | Qwen3.8 2.4T A95B Qwen3.8 2.4T A95B low |
|---|---|---|
| Punktzahl | 8.3 | 8.4 |
| Rang | #77 | #68 |
| Zuverlässigkeit | 10.0 | 9.6 |
| Konsistenz | 9.3 | 9.2 |
| Versuche | 69/69 | 69/69 |
| Korrekte Tests | ||
| Erfolgsquote pro Versuch | 85.5% | 73.9% |
| Instabile Tests | 2 | 2 |
| Gesamtläufe | 69 | 69 |
| Kosten pro Ergebnis | 14.402 | 19.825 |
| Gesamtkosten | $2.737 | $3.172 |
| Eingabepreis | $1.500 / 1M | $2.000 / 1M |
| Ausgabepreis | $9.000 / 1M | $6.000 / 1M |
| Gesamte Eingabe-Token | 348,103 | 313,881 |
| Ausgabe-Token | 11,045 | 123,706 |
| Denk-Token | 234,967 | 388,328 |
| Antwortzeit (Durchschnitt) | 18.59s | 120.40s |
| Antwortzeit (Maximum) | 145.92s | 534.21s |
| Antwortzeit (Gesamt) | 427.52s | 2769.16s |
| Parameter | ~500B insgesamt (~20B aktiv) | 2.4T insgesamt (95B aktiv) |
| Verfügbarkeit | Geschlossen | Gewichte verfügbar |
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#77 Gemini 3.5 Flash
high- Kosten
- $0.208
- Zeit
- 118.2s
- Token
- 23,158 tok
#68 Qwen3.8 2.4T A95B
low- Kosten
- $0.100
- Zeit
- 193.2s
- Token
- 16,767 tok
Top-Modelle nach Score
Score vs. Gesamtkosten
Antwortzeit (Durchschnitt)
Punktzahl vs Antwortzeit (Durchschnitt)
Gesamte Ausgabe-Token
Punktzahl vs Gesamte Ausgabe-Token
Kategorieaufschlüsselung
| Agentenaufgaben | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.5 Flash | 3.4 | 9.6 | 0.0% | 0 | 87.32s | 240,957 | 2,268 | 38,262 | |
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 151.76s | 200,602 | 2,661 | 13,832 |
| Anti-KI-Tricks | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.5 Flash | 10.0 | 10.0 | 100.0% | 0 | 2.57s | 492 | 174 | 4,997 | |
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 22.04s | 1,104 | 397 | 4,814 |
| Programmierung | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.5 Flash | 10.0 | 10.0 | 100.0% | 0 | 22.96s | 8,118 | 456 | 47,129 | |
| Qwen3.8 2.4T A95B | 7.8 | 9.3 | 66.7% | 0 | 172.53s | 6,716 | 21,405 | 57,399 |
| Kombiniert | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.5 Flash | 8.2 | 6.9 | 66.7% | 1 | 84.14s | 82,416 | 7,153 | 93,585 | |
| Qwen3.8 2.4T A95B | 8.2 | 6.9 | 66.7% | 1 | 231.85s | 85,267 | 8,008 | 50,681 |
| Datenanalyse und -extraktion | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.5 Flash | 10.0 | 10.0 | 100.0% | 0 | 6.43s | 7,548 | 279 | 8,466 | |
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 22.27s | 7,956 | 839 | 2,445 |
| Domänenspezifisch | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.5 Flash | 5.3 | 7.2 | 44.4% | 1 | 16.99s | 642 | 12 | 28,526 | |
| Qwen3.8 2.4T A95B | 3.2 | 9.3 | 0.0% | 0 | 287.65s | 1,008 | 16,133 | 156,114 |
| Allgemeine Intelligenz | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.5 Flash | 10.0 | 10.0 | 100.0% | 0 | 3.63s | 486 | 115 | 1,650 | |
| Qwen3.8 2.4T A95B | 6.1 | 3.1 | 66.7% | 1 | 22.97s | 606 | 44 | 1,497 |
| Befolgung von Anweisungen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.5 Flash | 10.0 | 10.0 | 100.0% | 0 | 3.35s | 615 | 70 | 3,799 | |
| Qwen3.8 2.4T A95B | 9.8 | 10.0 | 100.0% | 0 | 19.54s | 903 | 263 | 1,480 |
| Rätsellösen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.5 Flash | 10.0 | 10.0 | 100.0% | 0 | 3.23s | 558 | 241 | 4,940 | |
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 43.37s | 1,026 | 1,154 | 25,563 |
| Werkzeugaufrufe | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.5 Flash | 9.8 | 10.0 | 100.0% | 0 | 4.96s | 6,115 | 265 | 1,608 | |
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 25.88s | 8,481 | 302 | 975 |
| Allgemeinwissen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.5 Flash | 10.0 | 10.0 | 100.0% | 0 | 3.94s | 156 | 12 | 2,005 | |
| Qwen3.8 2.4T A95B | 3.0 | 10.0 | 0.0% | 0 | 422.46s | 212 | 72,500 | 73,528 |
Schnellvergleich
Vergleichspaar wechseln
GPT-5 MinimediumvsQwen3.8 2.4T A95BlowMuse Glimmer 30BxhighvsQwen3.8 2.4T A95BlowGemini 3.5 FlashhighvsKimi K3maxGemini 3.1 Pro PreviewmediumvsQwen3.8 2.4T A95BlowQwen3.8 2.4T A95BlowvsInklinghighKostenlos verfügbarMuse Spark 1.1highvsQwen3.8 2.4T A95BlowGemini 3.5 FlashhighvsGPT-6 LunamediumClaude Opus 4.8mediumvsGemini 3.5 FlashhighGemini 3.5 FlashhighvsQwen3.7 PlusmediumDeepSeek V4 Flash 0731highvsQwen3.8 2.4T A95BlowGemini 3.5 FlashhighvsGLM 5.2mediumClaude Sonnet 5mediumvsQwen3.8 2.4T A95Blow