Benchmark-Vergleich Qwen3.5 Plus 2026-02-15 (medium) vs Qwen3.6 Plus Preview (medium) vs GLM 5 Turbo (medium):GLM 5 Turbo (medium) führt bei Punktzahl mit 7.6. Qwen3.5 Plus 2026-02-15 (medium) führt bei Zuverlässigkeit mit 10.0. Qwen3.6 Plus Preview (medium) hat den niedrigsten Gesamtkosten mit $0.000. Qwen3.6 Plus Preview (medium) ist mit 15.25s am schnellsten.
Benchmarks aus AI BENCHY-Test-Suites generiert am:
2026-08-14
Rang
#87
Gesamte Ausgabe-Token
260,704
Antwortzeit (Durchschnitt)
89.19s
Gesamtkosten
$0.437
Rang
#236
Gesamte Ausgabe-Token
63,350
Antwortzeit (Durchschnitt)
15.25s
Gesamtkosten
$0.000
Rang
#78
Gesamte Ausgabe-Token
74,522
Antwortzeit (Durchschnitt)
23.00s
Gesamtkosten
$0.323
Empfohlenes ModellGLM 5 Turbo (medium)
Es hat hier die beste Punktzahl (7.6) und antwortet etwa 2.3x schneller als die anderen Modelle in diesem Vergleich.
Qwen3.6 Plus PreviewQwen3.6 Plus PreviewmediumArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.Veröffentlichung: 2026-04-20Kostenlos verfügbar
GLM 5 TurboGLM 5 TurbomediumArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.Veröffentlichung: 2026-03-15
Qwen3.6 Plus PreviewQwen3.6 Plus PreviewmediumArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.Veröffentlichung: 2026-04-20Kostenlos verfügbar
GLM 5 TurboGLM 5 TurbomediumArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.Veröffentlichung: 2026-03-15
Punktzahl
7.5Durchschnittswert über alle Benchmark-Tests.…
4.9Durchschnittswert über alle Benchmark-Tests.…
7.6Durchschnittswert über alle Benchmark-Tests.…
Rang
#87
#236
#78
Zuverlässigkeit
10.0Erfolgswert beim ersten Versuch: 10.0 bedeutet keine wiederholbaren Ziel-API- oder Rate-Limit-Fehler vor erfolgreichen Aufrufen; erfasste Fehler senken den Wert.…
k. A.Erfolgswert beim ersten Versuch: 10.0 bedeutet keine wiederholbaren Ziel-API- oder Rate-Limit-Fehler vor erfolgreichen Aufrufen; erfasste Fehler senken den Wert.…
10.0Erfolgswert beim ersten Versuch: 10.0 bedeutet keine wiederholbaren Ziel-API- oder Rate-Limit-Fehler vor erfolgreichen Aufrufen; erfasste Fehler senken den Wert.…
Konsistenz
8.5Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
8.6Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
8.1Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
Versuche
66/66
57/66
63/66
Korrekte Tests
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 4Zeitüberschreitung: 2API-Fehler: 1Ungültiger Werkzeugaufruf: 1Antwortzeit (Durchschnitt)89.19sAntwortzeit (Maximum)304.85sAntwortzeit (Gesamt)1337.92sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.API-Fehler: 8Falsche Antwort: 2Antwortzeit (Durchschnitt)15.25sAntwortzeit (Maximum)43.55sAntwortzeit (Gesamt)182.96sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 4Anweisungen nicht befolgt: 1Keine Antwort: 1Zeitüberschreitung: 1Antwortzeit (Durchschnitt)23.00sAntwortzeit (Maximum)194.23sAntwortzeit (Gesamt)482.97sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
Erfolgsquote pro Versuch
71.2%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
40.9%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
71.2%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
Instabile Tests
4Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
4Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Gesamtläufe
66Gesamtläufe…
57Gesamtläufe…
63Gesamtläufe…
Kosten pro Ergebnis
3.348Zeigt die durchschnittlichen Kosten pro korrekter Benchmark-Antwort in Cent an (niedriger ist besser).…
0.000Zeigt die durchschnittlichen Kosten pro korrekter Benchmark-Antwort in Cent an (niedriger ist besser).…
2.011Zeigt die durchschnittlichen Kosten pro korrekter Benchmark-Antwort in Cent an (niedriger ist besser).…
Gesamtkosten
$0.437Gesamtkosten (aktueller Preis)…
$0.000Gesamtkosten (aktueller Preis)…
$0.323Gesamtkosten (aktueller Preis)…
Eingabepreis
$0.260 / 1MEingabepreis…
$0.000 / 1MEingabepreis…
$1.200 / 1MEingabepreis…
Ausgabepreis
$1.560 / 1MAusgabepreis…
$0.000 / 1MAusgabepreis…
$4.000 / 1MAusgabepreis…
Gesamte Eingabe-Token
113,560Gesamte Eingabe-Token…
32,639Gesamte Eingabe-Token…
35,593Gesamte Eingabe-Token…
Ausgabe-Token
9,823Ausgabe-Token…
1,153Ausgabe-Token…
12,245Ausgabe-Token…
Denk-Token
250,881Denk-Token…
62,197Denk-Token…
62,277Denk-Token…
Antwortzeit (Durchschnitt)
89.19sAntwortzeit (Durchschnitt)…
15.25sAntwortzeit (Durchschnitt)…
23.00sAntwortzeit (Durchschnitt)…
Antwortzeit (Maximum)
304.85sAntwortzeit (Maximum)…
43.55sAntwortzeit (Maximum)…
194.23sAntwortzeit (Maximum)…
Antwortzeit (Gesamt)
1337.92sAntwortzeit (Gesamt)…
182.96sAntwortzeit (Gesamt)…
482.97sAntwortzeit (Gesamt)…
Parameter
~397B insgesamt (~17B aktiv)
~397B insgesamt (~17B aktiv)
744B insgesamt (40B aktiv)
Verfügbarkeit
Geschlossen
Geschlossen
Geschlossen
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#87 Qwen3.5 Plus 2026-02-15
medium
Kosten
$0.011
Zeit
125.5s
Token
7,040 tok
#236 Qwen3.6 Plus Preview
medium
Für dieses Modell wurde noch kein Showcase-Ergebnis generiert.
7.9Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
83.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)45.78sAntwortzeit (Maximum)81.20sAntwortzeit (Gesamt)91.57sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
45.78sAntwortzeit (Durchschnitt)…
672Gesamte Eingabe-Token…
205Ausgabe-Token…
21,236Denk-Token…
Qwen3.6 Plus PreviewArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
8.3Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
75.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.API-Fehler: 1Antwortzeit (Durchschnitt)11.69sAntwortzeit (Maximum)19.37sAntwortzeit (Gesamt)35.08sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
11.69sAntwortzeit (Durchschnitt)…
501Gesamte Eingabe-Token…
61Ausgabe-Token…
5,812Denk-Token…
GLM 5 TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)4.82sAntwortzeit (Maximum)7.69sAntwortzeit (Gesamt)19.26sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
7.1Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
44.4%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.API-Fehler: 1Falsche Antwort: 1Antwortzeit (Durchschnitt)180.70sAntwortzeit (Maximum)266.69sAntwortzeit (Gesamt)542.10sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
180.70sAntwortzeit (Durchschnitt)…
6,950Gesamte Eingabe-Token…
420Ausgabe-Token…
80,595Denk-Token…
Qwen3.6 Plus PreviewArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
9.8Durchschnittswert über alle Benchmark-Tests.…
3.3Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.API-Fehler: 1Antwortzeit (Durchschnitt)0msAntwortzeit (Maximum)0msAntwortzeit (Gesamt)0msEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
0msAntwortzeit (Durchschnitt)…
0Gesamte Eingabe-Token…
0Ausgabe-Token…
0Denk-Token…
GLM 5 TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
8.2Durchschnittswert über alle Benchmark-Tests.…
9.3Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine Antwort: 1Antwortzeit (Durchschnitt)45.90sAntwortzeit (Maximum)95.57sAntwortzeit (Gesamt)137.71sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
5.9Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Ungültiger Werkzeugaufruf: 1Antwortzeit (Durchschnitt)175.85sAntwortzeit (Maximum)304.85sAntwortzeit (Gesamt)351.70sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
175.85sAntwortzeit (Durchschnitt)…
87,576Gesamte Eingabe-Token…
8,085Ausgabe-Token…
69,183Denk-Token…
Qwen3.6 Plus PreviewArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
5.0Durchschnittswert über alle Benchmark-Tests.…
5.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
50.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)34.95sAntwortzeit (Maximum)34.95sAntwortzeit (Gesamt)34.95sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
34.95sAntwortzeit (Durchschnitt)…
14,934Gesamte Eingabe-Token…
452Ausgabe-Token…
13,073Denk-Token…
GLM 5 TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
5.0Durchschnittswert über alle Benchmark-Tests.…
5.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
50.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)13.88sAntwortzeit (Maximum)13.88sAntwortzeit (Gesamt)13.88sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)46.91sAntwortzeit (Maximum)46.91sAntwortzeit (Gesamt)46.91sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
46.91sAntwortzeit (Durchschnitt)…
7,782Gesamte Eingabe-Token…
270Ausgabe-Token…
14,916Denk-Token…
Qwen3.6 Plus PreviewArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)14.95sAntwortzeit (Maximum)15.40sAntwortzeit (Gesamt)29.90sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
14.95sAntwortzeit (Durchschnitt)…
7,782Gesamte Eingabe-Token…
270Ausgabe-Token…
10,706Denk-Token…
GLM 5 TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)6.19sAntwortzeit (Maximum)6.42sAntwortzeit (Gesamt)12.38sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Zeitüberschreitung: 1Falsche Antwort: 1Antwortzeit (Durchschnitt)17.50sAntwortzeit (Maximum)17.50sAntwortzeit (Gesamt)17.50sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
17.50sAntwortzeit (Durchschnitt)…
444Gesamte Eingabe-Token…
35Ausgabe-Token…
16,680Denk-Token…
Qwen3.6 Plus PreviewArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
3.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 2API-Fehler: 1Antwortzeit (Durchschnitt)22.08sAntwortzeit (Maximum)43.55sAntwortzeit (Gesamt)66.23sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
22.08sAntwortzeit (Durchschnitt)…
665Gesamte Eingabe-Token…
49Ausgabe-Token…
26,895Denk-Token…
GLM 5 TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
2.9Durchschnittswert über alle Benchmark-Tests.…
4.4Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
22.2%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
2Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 2Zeitüberschreitung: 1Antwortzeit (Durchschnitt)71.07sAntwortzeit (Maximum)194.23sAntwortzeit (Gesamt)213.22sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
1.6Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Zeitüberschreitung: 1Antwortzeit (Durchschnitt)79.86sAntwortzeit (Maximum)79.86sAntwortzeit (Gesamt)79.86sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
79.86sAntwortzeit (Durchschnitt)…
344Gesamte Eingabe-Token…
73Ausgabe-Token…
8,675Denk-Token…
Qwen3.6 Plus PreviewArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
3.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.API-Fehler: 1Antwortzeit (Durchschnitt)0msAntwortzeit (Maximum)0msAntwortzeit (Gesamt)0msEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
0msAntwortzeit (Durchschnitt)…
0Gesamte Eingabe-Token…
0Ausgabe-Token…
0Denk-Token…
GLM 5 TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
6.1Durchschnittswert über alle Benchmark-Tests.…
3.1Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)10.05sAntwortzeit (Maximum)10.05sAntwortzeit (Gesamt)10.05sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)31.93sAntwortzeit (Maximum)31.93sAntwortzeit (Gesamt)31.93sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
31.93sAntwortzeit (Durchschnitt)…
699Gesamte Eingabe-Token…
101Ausgabe-Token…
7,704Denk-Token…
Qwen3.6 Plus PreviewArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
6.5Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
50.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.API-Fehler: 1Antwortzeit (Durchschnitt)3.40sAntwortzeit (Maximum)3.40sAntwortzeit (Gesamt)3.40sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
3.40sAntwortzeit (Durchschnitt)…
381Gesamte Eingabe-Token…
27Ausgabe-Token…
1,383Denk-Token…
GLM 5 TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)5.38sAntwortzeit (Maximum)5.70sAntwortzeit (Gesamt)10.77sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)32.50sAntwortzeit (Maximum)49.12sAntwortzeit (Gesamt)65.01sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
32.50sAntwortzeit (Durchschnitt)…
696Gesamte Eingabe-Token…
301Ausgabe-Token…
13,853Denk-Token…
Qwen3.6 Plus PreviewArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
5.3Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.API-Fehler: 2Antwortzeit (Durchschnitt)7.52sAntwortzeit (Maximum)7.52sAntwortzeit (Gesamt)7.52sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
7.52sAntwortzeit (Durchschnitt)…
183Gesamte Eingabe-Token…
27Ausgabe-Token…
2,998Denk-Token…
GLM 5 TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
8.7Durchschnittswert über alle Benchmark-Tests.…
7.9Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
77.8%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 1Antwortzeit (Durchschnitt)5.23sAntwortzeit (Maximum)7.26sAntwortzeit (Gesamt)15.69sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)7.54sAntwortzeit (Maximum)7.54sAntwortzeit (Gesamt)7.54sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
7.54sAntwortzeit (Durchschnitt)…
8,193Gesamte Eingabe-Token…
309Ausgabe-Token…
909Denk-Token…
Qwen3.6 Plus PreviewArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)5.87sAntwortzeit (Maximum)5.87sAntwortzeit (Gesamt)5.87sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
5.87sAntwortzeit (Durchschnitt)…
8,193Gesamte Eingabe-Token…
267Ausgabe-Token…
1,330Denk-Token…
GLM 5 TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)9.84sAntwortzeit (Maximum)9.84sAntwortzeit (Gesamt)9.84sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)103.81sAntwortzeit (Maximum)103.81sAntwortzeit (Gesamt)103.81sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
103.81sAntwortzeit (Durchschnitt)…
204Gesamte Eingabe-Token…
24Ausgabe-Token…
17,130Denk-Token…
Qwen3.6 Plus PreviewArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
3.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.API-Fehler: 1Antwortzeit (Durchschnitt)0msAntwortzeit (Maximum)0msAntwortzeit (Gesamt)0msEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
0msAntwortzeit (Durchschnitt)…
0Gesamte Eingabe-Token…
0Ausgabe-Token…
0Denk-Token…
GLM 5 TurboArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
3.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)40.17sAntwortzeit (Maximum)40.17sAntwortzeit (Gesamt)40.17sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…