Navigation
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Verglichene Modelle

Benchmark-Vergleich Grok 4.6 (high) vs Seed 2.1 Turbo (low) vs Qwen3.8 2.4T A95B (low) vs Seed-2.0-Code (low): Grok 4.6 (high) führt bei Punktzahl mit 9.2. Grok 4.6 (high) führt bei Zuverlässigkeit mit 10.0. Seed-2.0-Code (low) hat den niedrigsten Gesamtkosten mit $0.681. Seed-2.0-Code (low) ist mit 65.89s am schnellsten.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-08-12

Rang
#11
Gesamte Ausgabe-Token
265,604
Antwortzeit (Durchschnitt)
79.38s
Gesamtkosten
$1.809
Rang
#15
Gesamte Ausgabe-Token
631,257
Antwortzeit (Durchschnitt)
168.41s
Gesamtkosten
$1.631
Rang
#46
Gesamte Ausgabe-Token
554,485
Antwortzeit (Durchschnitt)
132.39s
Gesamtkosten
$3.113
Rang
#66
Gesamte Ausgabe-Token
212,558
Antwortzeit (Durchschnitt)
65.89s
Gesamtkosten
$0.681
Empfohlenes Modell Grok 4.6 (high)

Es hat hier die beste Punktzahl (9.2) und antwortet etwa 1.5x schneller als die anderen Modelle in diesem Vergleich.

Detaillierter Vergleich

Metrik Grok 4.6 Grok 4.6 high Veröffentlichung: 2026-08-12 Seed 2.1 Turbo Seed 2.1 Turbo low Veröffentlichung: 2026-08-12 Qwen3.8 2.4T A95B Qwen3.8 2.4T A95B low Veröffentlichung: 2026-08-12 Seed-2.0-Code Seed-2.0-Code low Veröffentlichung: 2026-08-12
Punktzahl 9.2 9.1 8.2 7.7
Rang #11 #15 #46 #66
Zuverlässigkeit 10.0 9.9 9.1 5.7
Konsistenz 9.6 8.9 8.9 7.5
Versuche 66/66 66/66 66/66 66/66
Korrekte Tests
Erfolgsquote pro Versuch 84.9% 83.3% 78.8% 80.3%
Instabile Tests 1 3 3 7
Gesamtläufe 66 66 66 66
Kosten pro Ergebnis 10.046 9.591 19.453 5.235
Gesamtkosten $1.809 $1.631 $3.113 $0.681
Eingabepreis $2.000 / 1M $0.500 / 1M $2.000 / 1M $0.500 / 1M
Ausgabepreis $6.000 / 1M $2.500 / 1M $6.000 / 1M $3.000 / 1M
Gesamte Eingabe-Token 107,266 104,483 113,340 85,648
Ausgabe-Token 5,094 6,848 107,311 8,142
Denk-Token 260,510 624,409 447,174 204,416
Antwortzeit (Durchschnitt) 79.38s 168.41s 132.39s 65.89s
Antwortzeit (Maximum) 618.49s 739.98s 534.21s 485.92s
Antwortzeit (Gesamt) 1746.29s 3705.09s 2912.56s 1449.53s
Parameter ~1.7T insgesamt (~170B aktiv) ~200B insgesamt (~20B aktiv) 2.4T insgesamt (95B aktiv) ~200B insgesamt (~20B aktiv)
Verfügbarkeit Geschlossen Geschlossen Gewichte verfügbar Geschlossen

Modell-Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#11 SpaceXAI: Grok 4.6

high
Kosten
$0.107
Zeit
265.1s
Token
18,001 tok

#15 Seed 2.1 Turbo

low
Kosten
$0.049
Zeit
298.8s
Token
19,730 tok

#46 Qwen3.8 2.4T A95B

low
Kosten
$0.100
Zeit
193.2s
Token
16,767 tok

#66 Seed-2.0-Code

low
Provider returned error
Kosten
$0.000
Zeit
0.3s
Token
0 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Grok 4.6 10.0 10.0 100.0% 0 102.20s 9,579 379 51,829
Seed 2.1 Turbo 10.0 10.0 100.0% 0 360.85s 8,220 385 207,368
Qwen3.8 2.4T A95B 7.6 7.2 77.8% 1 172.53s 6,716 21,405 57,399
Seed-2.0-Code 7.0 5.0 77.8% 2 109.70s 7,948 455 55,759

Schnellvergleich

Vergleichspaar wechseln