Navigation
AI BENCHY
Advertise here

Verglichene Modelle

Benchmark-Vergleich Grok 4.20 Beta (medium) vs Grok 4.20 Multi Agent Beta (medium) vs Grok 4.1 Fast (medium) vs Gemini 3 Flash Preview (medium): Gemini 3 Flash Preview (medium) führt bei Punktzahl mit 9.6. Grok 4.1 Fast (medium) führt bei Zuverlässigkeit mit 10.0. Grok 4.1 Fast (medium) hat den niedrigsten Gesamtkosten mit $0.069. Grok 4.20 Multi Agent Beta (medium) ist mit 9.69s am schnellsten.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-07-28

Rang
#147
Gesamte Ausgabe-Token
93,212
Antwortzeit (Durchschnitt)
9.75s
Gesamtkosten
$0.750
Rang
#203
Gesamte Ausgabe-Token
600,042
Antwortzeit (Durchschnitt)
9.69s
Gesamtkosten
$5.599
Rang
#207
Gesamte Ausgabe-Token
98,340
Antwortzeit (Durchschnitt)
23.85s
Gesamtkosten
$0.069
Rang
#3
Gesamte Ausgabe-Token
232,650
Antwortzeit (Durchschnitt)
19.20s
Gesamtkosten
$0.742
Empfohlenes Modell Gemini 3 Flash Preview (medium)

Es hat hier die beste Punktzahl (9.6) und kostet etwa 2.9x weniger als die anderen Modelle in diesem Vergleich.

Detaillierter Vergleich

Metrik Grok 4.20 Beta Grok 4.20 Beta medium Veröffentlichung: 2026-03-12 Grok 4.20 Multi Agent Beta Grok 4.20 Multi Agent Beta medium Veröffentlichung: 2026-03-12 Grok 4.1 Fast Grok 4.1 Fast medium Veröffentlichung: 2025-11-19 Gemini 3 Flash Preview Gemini 3 Flash Preview medium Veröffentlichung: 2025-12-17
Punktzahl 6.0 4.8 4.7 9.6
Rang #147 #203 #207 #3
Zuverlässigkeit k. A. k. A. 10.0 10.0
Konsistenz 7.8 6.4 6.3 9.7
Korrekte Tests
Erfolgsquote pro Versuch 66.7% 48.5% 53.0% 98.5%
Instabile Tests 1 5 6 1
Gesamtläufe 52 52 57 66
Kosten pro Ergebnis 4.505 62.923 0.642 3.533
Gesamtkosten $0.750 $5.599 $0.069 $0.742
Eingabepreis $5.805 / 1M $4.235 / 1M $0.484 / 1M $0.500 / 1M
Ausgabepreis $5.805 / 1M $4.235 / 1M $0.484 / 1M $3.000 / 1M
Gesamte Eingabe-Token 35,955 721,952 42,845 87,861
Ausgabe-Token 1,647 294,668 2,006 5,486
Denk-Token 91,565 305,374 96,334 227,164
Antwortzeit (Durchschnitt) 9.75s 9.69s 23.85s 19.20s
Antwortzeit (Maximum) 31.36s 35.28s 121.79s 117.26s
Antwortzeit (Gesamt) 175.48s 155.07s 286.16s 422.42s

Modell-Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#147 Grok 4.20 Beta

medium
Kosten
$0.034
Zeit
91.0s
Token
13,523 tok

#203 Grok 4.20 Multi Agent Beta

medium
Kosten
$0.261
Zeit
123.4s
Token
199,344 tok

#207 Grok 4.1 Fast

medium
Grok 4.1 Fast is deprecated. xAI recommends switching to Grok 4.3 (https://openrouter.ai/x-ai/grok-4.3)
Kosten
$0.000
Zeit
0.1s
Token
0 tok

#3 Gemini 3 Flash Preview

medium
Kosten
$0.010
Zeit
18.4s
Token
3,351 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Grok 4.20 Beta 3.3 3.3 33.3% 0 31.36s 360 81 3,987
Grok 4.20 Multi Agent Beta 3.3 3.3 33.3% 0 27.11s 13,212 86 13,141
Grok 4.1 Fast 7.8 4.0 11.1% 1 23.58s 1,167 821 6,703
Gemini 3 Flash Preview 8.6 7.6 88.9% 1 84.40s 8,122 462 161,084

Schnellvergleich

Vergleichspaar wechseln