Navigation
Advertise here

Verglichene Modelle

Benchmark-Vergleich Grok 4.6 (high) vs Seed 2.1 Turbo (low) vs Qwen3.8 2.4T A95B (low) vs Seed-2.0-Code (low): Grok 4.6 (high) führt bei Punktzahl mit 9.3. Grok 4.6 (high) führt bei Zuverlässigkeit mit 10.0. Seed-2.0-Code (low) hat den niedrigsten Gesamtkosten mit $0.767. Seed-2.0-Code (low) ist mit 72.24s am schnellsten.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-09-24

Verglichene Modelle

Rang
#19
Gesamte Ausgabe-Token
282,217
Antwortzeit (Durchschnitt)
84.15s
Gesamtkosten
$1.908
Rang
#28
Gesamte Ausgabe-Token
597,236
Antwortzeit (Durchschnitt)
163.90s
Gesamtkosten
$1.546
Rang
#78
Gesamte Ausgabe-Token
495,541
Antwortzeit (Durchschnitt)
118.97s
Gesamtkosten
$2.672
Rang
#106
Gesamte Ausgabe-Token
241,309
Antwortzeit (Durchschnitt)
72.24s
Gesamtkosten
$0.767
Empfohlenes Modell Grok 4.6 (high)

Es hat die stärkste Punktzahl in diesem Vergleich (9.3) und die beste Gesamtbalance aus Kosten und Antwortzeit über alle 4 Modelle.

Detaillierter Vergleich

Metrik Grok 4.6 Grok 4.6 high Veröffentlichung: 2026-08-12 Seed 2.1 Turbo Seed 2.1 Turbo low Veröffentlichung: 2026-08-12 Qwen3.8 2.4T A95B Qwen3.8 2.4T A95B low Veröffentlichung: 2026-08-12 Seed-2.0-Code Seed-2.0-Code low Veröffentlichung: 2026-08-12
Punktzahl 9.3 9.1 8.1 7.7
Rang #19 #28 #78 #106
Zuverlässigkeit 10.0 10.0 9.4 8.5
Konsistenz 10.0 9.2 9.2 7.8
Versuche 66/66 66/66 66/66 66/66
Korrekte Tests
Erfolgsquote pro Versuch 86.4% 80.3% 72.7% 77.3%
Instabile Tests 0 2 2 6
Gesamtläufe 66 66 66 66
Kosten pro Ergebnis 10.042 9.091 17.812 5.899
Gesamtkosten $1.908 $1.546 $2.672 $0.767
Eingabepreis $2.000 / 1M $0.500 / 1M $2.000 / 1M $0.500 / 1M
Ausgabepreis $6.000 / 1M $2.500 / 1M $6.000 / 1M $3.000 / 1M
Gesamte Eingabe-Token 107,275 104,464 113,279 85,657
Ausgabe-Token 5,094 6,844 121,045 8,142
Denk-Token 277,123 590,392 374,496 233,167
Antwortzeit (Durchschnitt) 84.15s 163.90s 118.97s 72.24s
Antwortzeit (Maximum) 618.49s 739.98s 534.21s 485.92s
Antwortzeit (Gesamt) 1851.26s 3605.87s 2617.41s 1589.31s
Parameter ~1.7T insgesamt (~170B aktiv) ~200B insgesamt (~20B aktiv) 2.4T insgesamt (95B aktiv) ~200B insgesamt (~20B aktiv)
Verfügbarkeit Geschlossen Geschlossen Gewichte verfügbar Geschlossen

Modell-Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#19 SpaceXAI: Grok 4.6

high
Kosten
$0.107
Zeit
265.1s
Token
18,001 tok

#28 Seed 2.1 Turbo

low
Kosten
$0.049
Zeit
298.8s
Token
19,730 tok

#78 Qwen3.8 2.4T A95B

low
Kosten
$0.100
Zeit
193.2s
Token
16,767 tok

#106 Seed-2.0-Code

low
Provider returned error
Kosten
$0.000
Zeit
0.3s
Token
0 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Grok 4.6 10.0 10.0 100.0% 0 102.20s 9,579 379 51,829
Seed 2.1 Turbo 10.0 10.0 100.0% 0 360.85s 8,220 385 207,368
Qwen3.8 2.4T A95B 7.8 9.3 66.7% 0 172.53s 6,716 21,405 57,399
Seed-2.0-Code 7.0 7.1 55.6% 1 109.70s 7,948 455 55,759

Schnellvergleich

Vergleichspaar wechseln