- Rang
- #71
- Gesamte Ausgabe-Token
- 102,691
- Antwortzeit (Durchschnitt)
- 22.71s
- Gesamtkosten
- $1.585
Gemini 3.1 Pro Preview (medium) vs Qwen3.8 2.4T A95B (low)
Der Durchschnittsscore ist mit 8.4 vs 8.4 praktisch gleichauf. Gemini 3.1 Pro Preview (medium) hat die niedrigeren Benchmark-Kosten mit $1.585 vs $3.172. Gemini 3.1 Pro Preview (medium) ist schneller mit 22.71s vs 120.40s, mit Erfolgsraten von 89.9% vs 73.9%.
Verglichene Modelle
- Rang
- #68
- Gesamte Ausgabe-Token
- 512,034
- Antwortzeit (Durchschnitt)
- 120.40s
- Gesamtkosten
- $3.172
Empfohlenes Modell
Gemini 3.1 Pro Preview (medium)
Es hat hier die beste Punktzahl (8.4) und kostet etwa 2.0x weniger als Qwen3.8 2.4T A95B (low).
Detaillierter Vergleich
| Metrik | Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium | Qwen3.8 2.4T A95B Qwen3.8 2.4T A95B low |
|---|---|---|
| Punktzahl | 8.4 | 8.4 |
| Rang | #71 | #68 |
| Zuverlässigkeit | 9.8 | 9.6 |
| Konsistenz | 9.6 | 9.2 |
| Versuche | 69/69 | 69/69 |
| Korrekte Tests | ||
| Erfolgsquote pro Versuch | 89.9% | 73.9% |
| Instabile Tests | 1 | 2 |
| Gesamtläufe | 69 | 69 |
| Kosten pro Ergebnis | 7.924 | 19.825 |
| Gesamtkosten | $1.585 | $3.172 |
| Eingabepreis | $2.000 / 1M | $2.000 / 1M |
| Ausgabepreis | $12.000 / 1M | $6.000 / 1M |
| Gesamte Eingabe-Token | 176,208 | 313,881 |
| Ausgabe-Token | 6,093 | 123,706 |
| Denk-Token | 96,598 | 388,328 |
| Antwortzeit (Durchschnitt) | 22.71s | 120.40s |
| Antwortzeit (Maximum) | 88.68s | 534.21s |
| Antwortzeit (Gesamt) | 386.11s | 2769.16s |
| Parameter | ~1.2T insgesamt (~20B aktiv) | 2.4T insgesamt (95B aktiv) |
| Verfügbarkeit | Geschlossen | Gewichte verfügbar |
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#71 Gemini 3.1 Pro Preview
medium- Kosten
- $0.115
- Zeit
- 87.2s
- Token
- 9,629 tok
#68 Qwen3.8 2.4T A95B
low- Kosten
- $0.100
- Zeit
- 193.2s
- Token
- 16,767 tok
Top-Modelle nach Score
Score vs. Gesamtkosten
Antwortzeit (Durchschnitt)
Punktzahl vs Antwortzeit (Durchschnitt)
Gesamte Ausgabe-Token
Punktzahl vs Gesamte Ausgabe-Token
Kategorieaufschlüsselung
| Agentenaufgaben | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 4.7 | 1.6 | 66.7% | 1 | 56.17s | 83,912 | 861 | 4,592 | |
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 151.76s | 200,602 | 2,661 | 13,832 |
| Anti-KI-Tricks | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 7.90s | 498 | 112 | 3,218 | |
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 22.04s | 1,104 | 397 | 4,814 |
| Programmierung | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 7.9 | 9.9 | 66.7% | 0 | 40.17s | 8,124 | 435 | 41,247 | |
| Qwen3.8 2.4T A95B | 7.8 | 9.3 | 66.7% | 0 | 172.53s | 6,716 | 21,405 | 57,399 |
| Kombiniert | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 9.8 | 10.0 | 100.0% | 0 | 40.39s | 67,910 | 3,687 | 23,111 | |
| Qwen3.8 2.4T A95B | 8.2 | 6.9 | 66.7% | 1 | 231.85s | 85,267 | 8,008 | 50,681 |
| Datenanalyse und -extraktion | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 7.72s | 7,265 | 279 | 3,904 | |
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 22.27s | 7,956 | 839 | 2,445 |
| Domänenspezifisch | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 7.7 | 10.0 | 66.7% | 0 | 20.29s | 644 | 18 | 11,704 | |
| Qwen3.8 2.4T A95B | 3.2 | 9.3 | 0.0% | 0 | 287.65s | 1,008 | 16,133 | 156,114 |
| Allgemeine Intelligenz | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 11.77s | 490 | 108 | 1,179 | |
| Qwen3.8 2.4T A95B | 6.1 | 3.1 | 66.7% | 1 | 22.97s | 606 | 44 | 1,497 |
| Befolgung von Anweisungen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 9.56s | 621 | 72 | 2,236 | |
| Qwen3.8 2.4T A95B | 9.8 | 10.0 | 100.0% | 0 | 19.54s | 903 | 263 | 1,480 |
| Rätsellösen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 6.90s | 570 | 235 | 3,128 | |
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 43.37s | 1,026 | 1,154 | 25,563 |
| Werkzeugaufrufe | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 23.15s | 6,018 | 274 | 982 | |
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 25.88s | 8,481 | 302 | 975 |
| Allgemeinwissen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 6.27s | 156 | 12 | 1,297 | |
| Qwen3.8 2.4T A95B | 3.0 | 10.0 | 0.0% | 0 | 422.46s | 212 | 72,500 | 73,528 |
Schnellvergleich
Vergleichspaar wechseln
GPT-5 MinimediumvsQwen3.8 2.4T A95BlowMuse Glimmer 30BxhighvsQwen3.8 2.4T A95BlowGemini 3.1 Pro PreviewmediumvsInklinghighKostenlos verfügbarGemini 3.1 Pro PreviewmediumvsMuse Glimmer 30BxhighGemini 3.1 Pro PreviewmediumvsMuse Spark 1.1highDeepSeek V4 Flash 0731highvsGemini 3.1 Pro PreviewmediumQwen3.8 2.4T A95BlowvsInklinghighKostenlos verfügbarMuse Spark 1.1highvsQwen3.8 2.4T A95BlowGemini 3.1 Pro PreviewmediumvsGLM 5.2highDeepSeek V4 Flash 0731highvsQwen3.8 2.4T A95BlowClaude Sonnet 5mediumvsQwen3.8 2.4T A95BlowQwen3.8 2.4T A95BlowvsGLM 5.2high