Google: Gemini 3.1 Flash Lite vs Z.ai: GLM 5V Turbo
Zusammenfassung
Gemini 3.1 Flash Lite vs GLM 5V Turbo Benchmark-Vergleich: GLM 5V Turbo führt beim Durchschnittsscore mit 7.3 vs 6.4. Gemini 3.1 Flash Lite hat die niedrigeren Benchmark-Kosten mit $0.028 vs $0.457. Gemini 3.1 Flash Lite ist schneller mit 1.89s vs 23.08s, mit Erfolgsraten von 61.9% vs 68.3%.
Empfohlenes Modell: Gemini 3.1 Flash Lite - Es bietet den besten Gesamtkompromiss: wettbewerbsfähige Punktzahl (6.4), niedrigere Kosten als GLM 5V Turbo und ausgewogene Antwortzeit.
Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-06-18
GLM 5V TurboGLM 5V TurbomediumArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.Veröffentlichung: 2026-04-01
GLM 5V TurboGLM 5V TurbomediumArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.Veröffentlichung: 2026-04-01
Punktzahl
6.4Durchschnittswert über alle Benchmark-Tests.…
7.3Durchschnittswert über alle Benchmark-Tests.…
Rang
#85
#56
Zuverlässigkeit
10.0Erfolgswert beim ersten Versuch: 10.0 bedeutet keine wiederholbaren Ziel-API- oder Rate-Limit-Fehler vor erfolgreichen Aufrufen; erfasste Fehler senken den Wert.…
10.0Erfolgswert beim ersten Versuch: 10.0 bedeutet keine wiederholbaren Ziel-API- oder Rate-Limit-Fehler vor erfolgreichen Aufrufen; erfasste Fehler senken den Wert.…
Konsistenz
9.3Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
7.9Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
Korrekte Tests
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 9Antwortzeit (Durchschnitt)1.89sAntwortzeit (Maximum)5.66sAntwortzeit (Gesamt)39.62sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 7Ungültiger Werkzeugaufruf: 2Anweisungen nicht befolgt: 1Antwortzeit (Durchschnitt)23.08sAntwortzeit (Maximum)95.88sAntwortzeit (Gesamt)484.63sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
Erfolgsquote pro Versuch
61.9%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
68.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
Instabile Tests
2Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
6Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Gesamtläufe
63Gesamtläufe…
63Gesamtläufe…
Kosten pro Ergebnis
0.227Zeigt die durchschnittlichen Kosten pro korrekter Benchmark-Antwort in Cent an (niedriger ist besser).…
4.151Zeigt die durchschnittlichen Kosten pro korrekter Benchmark-Antwort in Cent an (niedriger ist besser).…
Gesamtkosten
$0.028Gesamtkosten (aktueller Preis)…
$0.457Gesamtkosten (aktueller Preis)…
Eingabepreis
$0.250 / 1MEingabepreis…
$1.200 / 1MEingabepreis…
Ausgabepreis
$1.500 / 1MAusgabepreis…
$4.000 / 1MAusgabepreis…
Gesamte Eingabe-Token
36,892Gesamte Eingabe-Token…
44,615Gesamte Eingabe-Token…
Ausgabe-Token
2,732Ausgabe-Token…
2,347Ausgabe-Token…
Denk-Token
9,260Denk-Token…
98,415Denk-Token…
Antwortzeit (Durchschnitt)
1.89sAntwortzeit (Durchschnitt)…
23.08sAntwortzeit (Durchschnitt)…
Antwortzeit (Maximum)
5.66sAntwortzeit (Maximum)…
95.88sAntwortzeit (Maximum)…
Antwortzeit (Gesamt)
39.62sAntwortzeit (Gesamt)…
484.63sAntwortzeit (Gesamt)…
Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
6.2Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
75.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
2Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 2Antwortzeit (Durchschnitt)1.84sAntwortzeit (Maximum)3.08sAntwortzeit (Gesamt)7.37sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
1.84sAntwortzeit (Durchschnitt)…
500Gesamte Eingabe-Token…
1,013Ausgabe-Token…
1,548Denk-Token…
GLM 5V TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
7.2Durchschnittswert über alle Benchmark-Tests.…
6.1Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
75.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
2Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 1Falsche Antwort: 1Antwortzeit (Durchschnitt)10.76sAntwortzeit (Maximum)14.40sAntwortzeit (Gesamt)43.02sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 2Antwortzeit (Durchschnitt)1.53sAntwortzeit (Maximum)1.97sAntwortzeit (Gesamt)4.58sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
1.53sAntwortzeit (Durchschnitt)…
8,132Gesamte Eingabe-Token…
471Ausgabe-Token…
1,072Denk-Token…
GLM 5V TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
6.0Durchschnittswert über alle Benchmark-Tests.…
7.2Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
55.6%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 2Antwortzeit (Durchschnitt)63.38sAntwortzeit (Maximum)95.88sAntwortzeit (Gesamt)190.15sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)4.48sAntwortzeit (Maximum)4.48sAntwortzeit (Gesamt)4.48sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
4.48sAntwortzeit (Durchschnitt)…
12,870Gesamte Eingabe-Token…
348Ausgabe-Token…
975Denk-Token…
GLM 5V TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
6.9Durchschnittswert über alle Benchmark-Tests.…
3.8Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Ungültiger Werkzeugaufruf: 1Antwortzeit (Durchschnitt)15.06sAntwortzeit (Maximum)15.06sAntwortzeit (Gesamt)15.06sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)1.44sAntwortzeit (Maximum)1.51sAntwortzeit (Gesamt)2.89sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
1.44sAntwortzeit (Durchschnitt)…
7,453Gesamte Eingabe-Token…
291Ausgabe-Token…
697Denk-Token…
GLM 5V TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)9.60sAntwortzeit (Maximum)9.92sAntwortzeit (Gesamt)19.19sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 2Antwortzeit (Durchschnitt)1.52sAntwortzeit (Maximum)1.63sAntwortzeit (Gesamt)4.57sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
1.52sAntwortzeit (Durchschnitt)…
639Gesamte Eingabe-Token…
15Ausgabe-Token…
1,214Denk-Token…
GLM 5V TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
5.3Durchschnittswert über alle Benchmark-Tests.…
7.2Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
44.4%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 2Antwortzeit (Durchschnitt)38.15sAntwortzeit (Maximum)67.08sAntwortzeit (Gesamt)114.45sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)1.37sAntwortzeit (Maximum)1.37sAntwortzeit (Gesamt)1.37sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
1.37sAntwortzeit (Durchschnitt)…
492Gesamte Eingabe-Token…
69Ausgabe-Token…
438Denk-Token…
GLM 5V TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)11.09sAntwortzeit (Maximum)11.09sAntwortzeit (Gesamt)11.09sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)1.52sAntwortzeit (Maximum)1.68sAntwortzeit (Gesamt)3.04sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
1.52sAntwortzeit (Durchschnitt)…
619Gesamte Eingabe-Token…
72Ausgabe-Token…
760Denk-Token…
GLM 5V TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
9.9Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)3.74sAntwortzeit (Maximum)5.23sAntwortzeit (Gesamt)7.47sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)1.40sAntwortzeit (Maximum)1.41sAntwortzeit (Gesamt)4.20sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
1.40sAntwortzeit (Durchschnitt)…
570Gesamte Eingabe-Token…
210Ausgabe-Token…
1,191Denk-Token…
GLM 5V TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
7.7Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)10.24sAntwortzeit (Maximum)16.95sAntwortzeit (Gesamt)30.72sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)5.66sAntwortzeit (Maximum)5.66sAntwortzeit (Gesamt)5.66sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
5.66sAntwortzeit (Durchschnitt)…
5,457Gesamte Eingabe-Token…
234Ausgabe-Token…
945Denk-Token…
GLM 5V TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
7.0Durchschnittswert über alle Benchmark-Tests.…
3.7Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Ungültiger Werkzeugaufruf: 1Antwortzeit (Durchschnitt)12.53sAntwortzeit (Maximum)12.53sAntwortzeit (Gesamt)12.53sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)1.46sAntwortzeit (Maximum)1.46sAntwortzeit (Gesamt)1.46sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
1.46sAntwortzeit (Durchschnitt)…
160Gesamte Eingabe-Token…
9Ausgabe-Token…
420Denk-Token…
GLM 5V TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
3.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)40.96sAntwortzeit (Maximum)40.96sAntwortzeit (Gesamt)40.96sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…