Navigation
AI BENCHY
Advertise here

Verglichene Modelle

Benchmark-Vergleich GPT-6 Astra (high) vs Gemini 3.8 Flash (high) vs Claude Fable 5.1 (high): Gemini 3.8 Flash (high) führt bei Punktzahl mit 9.9. Gemini 3.8 Flash (high) führt bei Zuverlässigkeit mit 10.0. Gemini 3.8 Flash (high) hat den niedrigsten Gesamtkosten mit $1.595. Claude Fable 5.1 (high) ist mit 13.59s am schnellsten.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-09-04

Rang
#4
Gesamte Ausgabe-Token
53,622
Antwortzeit (Durchschnitt)
18.65s
Gesamtkosten
$3.474
Rang
#2
Gesamte Ausgabe-Token
408,188
Antwortzeit (Durchschnitt)
37.19s
Gesamtkosten
$1.595
Rang
#25
Gesamte Ausgabe-Token
40,071
Antwortzeit (Durchschnitt)
13.59s
Gesamtkosten
$3.364
Empfohlenes Modell Gemini 3.8 Flash (high)

Es hat hier die beste Punktzahl (9.9) und kostet etwa 2.1x weniger als die anderen Modelle in diesem Vergleich.

Detaillierter Vergleich

Metrik GPT-6 Astra GPT-6 Astra high Veröffentlichung: 2026-09-04 Gemini 3.8 Flash Gemini 3.8 Flash high Veröffentlichung: 2026-09-02 Claude Fable 5.1 Claude Fable 5.1 high Veröffentlichung: 2026-09-02
Punktzahl 9.9 9.9 9.0
Rang #4 #2 #25
Zuverlässigkeit 9.9 10.0 10.0
Konsistenz 9.6 9.6 9.6
Versuche 66/66 66/66 66/66
Korrekte Tests
Erfolgsquote pro Versuch 97.0% 98.5% 89.4%
Instabile Tests 1 1 1
Gesamtläufe 66 66 66
Kosten pro Ergebnis 16.543 7.592 17.701
Gesamtkosten $3.474 $1.595 $3.364
Eingabepreis $10.000 / 1M $0.750 / 1M $10.000 / 1M
Ausgabepreis $50.000 / 1M $3.750 / 1M $50.000 / 1M
Gesamte Eingabe-Token 79,290 84,593 135,958
Ausgabe-Token 4,847 10,517 7,930
Denk-Token 48,775 397,671 32,141
Antwortzeit (Durchschnitt) 18.65s 37.19s 13.59s
Antwortzeit (Maximum) 254.93s 177.08s 40.17s
Antwortzeit (Gesamt) 410.28s 818.19s 298.90s
Parameter ~2T insgesamt (~150B aktiv) ~500B insgesamt (~20B aktiv) ~9.5T insgesamt (~878B aktiv)
Verfügbarkeit Geschlossen Geschlossen Geschlossen

Modell-Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#4 GPT-6 Astra

high
Kosten
$0.457
Zeit
176.7s
Token
9,218 tok

#2 Gemini 3.8 Flash

high
Kosten
$0.077
Zeit
129.1s
Token
20,373 tok

#25 Claude Fable 5.1

high
Kosten
$0.384
Zeit
102.5s
Token
7,824 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
GPT-6 Astra 10.0 10.0 100.0% 0 5.86s 7,302 392 2,387
Gemini 3.8 Flash 10.0 10.0 100.0% 0 29.30s 8,118 462 50,196
Claude Fable 5.1 8.4 7.4 88.9% 1 13.91s 10,608 520 6,503

Schnellvergleich

Vergleichspaar wechseln