Navigation
Advertise here

Verglichene Modelle

Benchmark-Vergleich Grok 4.20 Beta (medium) vs Grok 4.20 Multi Agent Beta (medium) vs Grok 4.1 Fast (medium) vs Gemini 3 Flash Preview (medium): Gemini 3 Flash Preview (medium) führt bei Punktzahl mit 9.5. Grok 4.1 Fast (medium) führt bei Zuverlässigkeit mit 10.0. Grok 4.1 Fast (medium) hat den niedrigsten Gesamtkosten mit $0.069. Grok 4.20 Multi Agent Beta (medium) ist mit 9.69s am schnellsten.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-09-10

Verglichene Modelle

Rang
#210
Gesamte Ausgabe-Token
93,212
Antwortzeit (Durchschnitt)
9.75s
Gesamtkosten
$0.750
Rang
#289
Gesamte Ausgabe-Token
600,042
Antwortzeit (Durchschnitt)
9.69s
Gesamtkosten
$5.599
Rang
#294
Gesamte Ausgabe-Token
98,340
Antwortzeit (Durchschnitt)
23.85s
Gesamtkosten
$0.069
Rang
#10
Gesamte Ausgabe-Token
239,608
Antwortzeit (Durchschnitt)
19.86s
Gesamtkosten
$0.763
Empfohlenes Modell Gemini 3 Flash Preview (medium)

Es hat hier die beste Punktzahl (9.5) und kostet etwa 2.8x weniger als die anderen Modelle in diesem Vergleich.

Detaillierter Vergleich

Metrik Grok 4.20 Beta Grok 4.20 Beta medium Veröffentlichung: 2026-03-12 Grok 4.20 Multi Agent Beta Grok 4.20 Multi Agent Beta medium Veröffentlichung: 2026-03-12 Grok 4.1 Fast Grok 4.1 Fast medium Veröffentlichung: 2025-11-19 Gemini 3 Flash Preview Gemini 3 Flash Preview medium Veröffentlichung: 2025-12-17
Punktzahl 6.0 4.8 4.7 9.5
Rang #210 #289 #294 #10
Zuverlässigkeit k. A. k. A. 10.0 10.0
Konsistenz 7.8 6.4 6.3 9.7
Versuche 52/66 52/66 57/66 66/66
Korrekte Tests
Erfolgsquote pro Versuch 66.7% 48.5% 53.0% 93.9%
Instabile Tests 1 5 6 1
Gesamtläufe 52 52 57 66
Kosten pro Ergebnis 4.505 62.923 0.642 3.814
Gesamtkosten $0.750 $5.599 $0.069 $0.763
Eingabepreis $5.805 / 1M $4.235 / 1M $0.484 / 1M $0.500 / 1M
Ausgabepreis $5.805 / 1M $4.235 / 1M $0.484 / 1M $3.000 / 1M
Gesamte Eingabe-Token 35,955 721,952 42,845 87,870
Ausgabe-Token 1,647 294,668 2,006 5,486
Denk-Token 91,565 305,374 96,334 234,122
Antwortzeit (Durchschnitt) 9.75s 9.69s 23.85s 19.86s
Antwortzeit (Maximum) 31.36s 35.28s 121.79s 117.26s
Antwortzeit (Gesamt) 175.48s 155.07s 286.16s 436.88s
Parameter ~1T insgesamt (~100B aktiv) ~1T insgesamt (~100B aktiv) ~500B insgesamt (~50B aktiv) ~500B insgesamt (~20B aktiv)
Verfügbarkeit Geschlossen Geschlossen Geschlossen Geschlossen

Modell-Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#210 Grok 4.20 Beta

medium
Kosten
$0.034
Zeit
91.0s
Token
13,523 tok

#289 Grok 4.20 Multi Agent Beta

medium
Kosten
$0.261
Zeit
123.4s
Token
199,344 tok

#294 Grok 4.1 Fast

medium
Grok 4.1 Fast is deprecated. xAI recommends switching to Grok 4.3 (https://openrouter.ai/x-ai/grok-4.3)
Kosten
$0.000
Zeit
0.1s
Token
0 tok

#10 Gemini 3 Flash Preview

medium
Kosten
$0.010
Zeit
18.4s
Token
3,351 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Grok 4.20 Beta 3.3 3.3 33.3% 0 31.36s 360 81 3,987
Grok 4.20 Multi Agent Beta 3.3 3.3 33.3% 0 27.11s 13,212 86 13,141
Grok 4.1 Fast 7.8 4.0 11.1% 1 23.58s 1,167 821 6,703
Gemini 3 Flash Preview 8.6 7.6 88.9% 1 84.40s 8,122 462 161,084

Schnellvergleich

Vergleichspaar wechseln