Gemini 3.5 Flash (minimal) vs GLM 5 Turbo (medium)
GLM 5 Turbo (medium) führt beim Durchschnittsscore mit 7.6 vs 6.8. Gemini 3.5 Flash (minimal) hat die niedrigeren Benchmark-Kosten mit $0.300 vs $0.323. Gemini 3.5 Flash (minimal) ist schneller mit 2.65s vs 23.00s, mit Erfolgsraten von 65.2% vs 71.2%.
Benchmarks aus AI BENCHY-Test-Suites generiert am:
2026-07-25
⋮⋮
Rang
#96
Gesamte Ausgabe-Token
16,454
Antwortzeit (Durchschnitt)
2.65s
Gesamtkosten
$0.300
⋮⋮
Rang
#56
Gesamte Ausgabe-Token
74,522
Antwortzeit (Durchschnitt)
23.00s
Gesamtkosten
$0.323
Empfohlenes ModellGemini 3.5 Flash (minimal)
Die Punktzahl bleibt nah an der besten hier (6.8 vs 7.6) und es antwortet etwa 8.7x schneller als GLM 5 Turbo (medium).
GLM 5 TurboGLM 5 TurbomediumArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.Veröffentlichung: 2026-03-15
GLM 5 TurboGLM 5 TurbomediumArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.Veröffentlichung: 2026-03-15
Punktzahl
6.8Durchschnittswert über alle Benchmark-Tests.…
7.6Durchschnittswert über alle Benchmark-Tests.…
Rang
#96
#56
Zuverlässigkeit
10.0Erfolgswert beim ersten Versuch: 10.0 bedeutet keine wiederholbaren Ziel-API- oder Rate-Limit-Fehler vor erfolgreichen Aufrufen; erfasste Fehler senken den Wert.…
10.0Erfolgswert beim ersten Versuch: 10.0 bedeutet keine wiederholbaren Ziel-API- oder Rate-Limit-Fehler vor erfolgreichen Aufrufen; erfasste Fehler senken den Wert.…
Konsistenz
9.6Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
8.1Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
Korrekte Tests
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 5Ungültiger Werkzeugaufruf: 2Anweisungen nicht befolgt: 1Antwortzeit (Durchschnitt)2.65sAntwortzeit (Maximum)25.26sAntwortzeit (Gesamt)58.27sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 4Anweisungen nicht befolgt: 1Keine Antwort: 1Zeitüberschreitung: 1Antwortzeit (Durchschnitt)23.00sAntwortzeit (Maximum)194.23sAntwortzeit (Gesamt)482.97sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
Erfolgsquote pro Versuch
65.2%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
71.2%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
Instabile Tests
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
4Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Gesamtläufe
66Gesamtläufe…
63Gesamtläufe…
Kosten pro Ergebnis
2.138Zeigt die durchschnittlichen Kosten pro korrekter Benchmark-Antwort in Cent an (niedriger ist besser).…
2.011Zeigt die durchschnittlichen Kosten pro korrekter Benchmark-Antwort in Cent an (niedriger ist besser).…
Gesamtkosten
$0.300Gesamtkosten (aktueller Preis)…
$0.323Gesamtkosten (aktueller Preis)…
Eingabepreis
$1.500 / 1MEingabepreis…
$1.200 / 1MEingabepreis…
Ausgabepreis
$9.000 / 1MAusgabepreis…
$4.000 / 1MAusgabepreis…
Gesamte Eingabe-Token
100,753Gesamte Eingabe-Token…
35,593Gesamte Eingabe-Token…
Ausgabe-Token
16,454Ausgabe-Token…
12,245Ausgabe-Token…
Denk-Token
0Denk-Token…
62,277Denk-Token…
Antwortzeit (Durchschnitt)
2.65sAntwortzeit (Durchschnitt)…
23.00sAntwortzeit (Durchschnitt)…
Antwortzeit (Maximum)
25.26sAntwortzeit (Maximum)…
194.23sAntwortzeit (Maximum)…
Antwortzeit (Gesamt)
58.27sAntwortzeit (Gesamt)…
482.97sAntwortzeit (Gesamt)…
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
50.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 2Antwortzeit (Durchschnitt)892msAntwortzeit (Maximum)1.38sAntwortzeit (Gesamt)3.57sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
892msAntwortzeit (Durchschnitt)…
492Gesamte Eingabe-Token…
405Ausgabe-Token…
0Denk-Token…
GLM 5 TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)4.82sAntwortzeit (Maximum)7.69sAntwortzeit (Gesamt)19.26sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
9.9Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 1Falsche Antwort: 1Antwortzeit (Durchschnitt)2.75sAntwortzeit (Maximum)5.51sAntwortzeit (Gesamt)8.26sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
2.75sAntwortzeit (Durchschnitt)…
8,122Gesamte Eingabe-Token…
3,456Ausgabe-Token…
0Denk-Token…
GLM 5 TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
8.2Durchschnittswert über alle Benchmark-Tests.…
9.3Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine Antwort: 1Antwortzeit (Durchschnitt)45.90sAntwortzeit (Maximum)95.57sAntwortzeit (Gesamt)137.71sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Ungültiger Werkzeugaufruf: 2Antwortzeit (Durchschnitt)14.41sAntwortzeit (Maximum)25.26sAntwortzeit (Gesamt)28.81sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
14.41sAntwortzeit (Durchschnitt)…
76,686Gesamte Eingabe-Token…
11,581Ausgabe-Token…
0Denk-Token…
GLM 5 TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
5.0Durchschnittswert über alle Benchmark-Tests.…
5.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
50.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)13.88sAntwortzeit (Maximum)13.88sAntwortzeit (Gesamt)13.88sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)1.66sAntwortzeit (Maximum)2.11sAntwortzeit (Gesamt)3.32sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
1.66sAntwortzeit (Durchschnitt)…
7,548Gesamte Eingabe-Token…
279Ausgabe-Token…
0Denk-Token…
GLM 5 TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)6.19sAntwortzeit (Maximum)6.42sAntwortzeit (Gesamt)12.38sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)899msAntwortzeit (Maximum)1.04sAntwortzeit (Gesamt)2.70sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
899msAntwortzeit (Durchschnitt)…
633Gesamte Eingabe-Token…
12Ausgabe-Token…
0Denk-Token…
GLM 5 TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
2.9Durchschnittswert über alle Benchmark-Tests.…
4.4Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
22.2%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
2Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 2Zeitüberschreitung: 1Antwortzeit (Durchschnitt)71.07sAntwortzeit (Maximum)194.23sAntwortzeit (Gesamt)213.22sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)922msAntwortzeit (Maximum)922msAntwortzeit (Gesamt)922msEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
922msAntwortzeit (Durchschnitt)…
486Gesamte Eingabe-Token…
117Ausgabe-Token…
0Denk-Token…
GLM 5 TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
6.1Durchschnittswert über alle Benchmark-Tests.…
3.1Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)10.05sAntwortzeit (Maximum)10.05sAntwortzeit (Gesamt)10.05sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
5.8Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)893msAntwortzeit (Maximum)964msAntwortzeit (Gesamt)1.79sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
893msAntwortzeit (Durchschnitt)…
615Gesamte Eingabe-Token…
76Ausgabe-Token…
0Denk-Token…
GLM 5 TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)5.38sAntwortzeit (Maximum)5.70sAntwortzeit (Gesamt)10.77sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)1.45sAntwortzeit (Maximum)2.30sAntwortzeit (Gesamt)4.36sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
1.45sAntwortzeit (Durchschnitt)…
558Gesamte Eingabe-Token…
282Ausgabe-Token…
0Denk-Token…
GLM 5 TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
8.7Durchschnittswert über alle Benchmark-Tests.…
7.9Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
77.8%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 1Antwortzeit (Durchschnitt)5.23sAntwortzeit (Maximum)7.26sAntwortzeit (Gesamt)15.69sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)2.79sAntwortzeit (Maximum)2.79sAntwortzeit (Gesamt)2.79sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
2.79sAntwortzeit (Durchschnitt)…
5,457Gesamte Eingabe-Token…
234Ausgabe-Token…
0Denk-Token…
GLM 5 TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)9.84sAntwortzeit (Maximum)9.84sAntwortzeit (Gesamt)9.84sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)1.76sAntwortzeit (Maximum)1.76sAntwortzeit (Gesamt)1.76sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
1.76sAntwortzeit (Durchschnitt)…
156Gesamte Eingabe-Token…
12Ausgabe-Token…
0Denk-Token…
GLM 5 TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
3.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)40.17sAntwortzeit (Maximum)40.17sAntwortzeit (Gesamt)40.17sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…