GLM 5.2 (high) führt beim Durchschnittsscore mit 8.0 vs 7.9. Qwen3.8 27B (low) hat die niedrigeren Benchmark-Kosten mit ~$0.071 vs $1.623. Qwen3.8 27B (low) ist schneller mit 39.11s vs 69.86s, mit Erfolgsraten von 68.2% vs 69.7%.
Benchmarks aus AI BENCHY-Test-Suites generiert am:
2026-09-29
Verglichene Modelle
Die Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
Rang
#101
Gesamte Ausgabe-Token
169,329
Antwortzeit (Durchschnitt)
39.11s
Gesamtkosten
~$0.071Nur geschätzte GPU-Stromkosten. Der übrige Computer und die Anschaffungskosten der Hardware sind nicht enthalten. NVIDIA GeForce RTX 3090: 0.7171 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.070898.
Rang
#94
Gesamte Ausgabe-Token
364,655
Antwortzeit (Durchschnitt)
69.86s
Gesamtkosten
$1.623
Empfohlenes ModellQwen3.8 27B (low)
Die Punktzahl bleibt nah an der besten hier (7.9 vs 8.0) und es kostet etwa 22.9x weniger als GLM 5.2 (high).
Detaillierter Vergleich
Metrik
Qwen3.8 27BQwen3.8 27BlowDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.Veröffentlichung: 2026-08-14
Qwen3.8 27BQwen3.8 27BlowDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.Veröffentlichung: 2026-08-14
10.0Erfolgswert beim ersten Versuch: 10.0 bedeutet keine wiederholbaren Ziel-API- oder Rate-Limit-Fehler vor erfolgreichen Aufrufen; erfasste Fehler senken den Wert.…
10.0Erfolgswert beim ersten Versuch: 10.0 bedeutet keine wiederholbaren Ziel-API- oder Rate-Limit-Fehler vor erfolgreichen Aufrufen; erfasste Fehler senken den Wert.…
Konsistenz
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
8.6Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
Versuche
66/66
66/66
Korrekte Tests
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 4Keine Antwort: 2Anweisungen nicht befolgt: 1Antwortzeit (Durchschnitt)39.11sAntwortzeit (Maximum)376.04sAntwortzeit (Gesamt)860.51sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Zeitüberschreitung: 3Keine Antwort: 2Falsche Antwort: 2Anweisungen nicht befolgt: 1Antwortzeit (Durchschnitt)69.86sAntwortzeit (Maximum)599.43sAntwortzeit (Gesamt)1536.98sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
Erfolgsquote pro Versuch
68.2%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
69.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
Instabile Tests
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
3Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Gesamtläufe
66Gesamtläufe…
66Gesamtläufe…
Kosten pro Ergebnis
~0.473Nur geschätzte GPU-Stromkosten. Der übrige Computer und die Anschaffungskosten der Hardware sind nicht enthalten. NVIDIA GeForce RTX 3090: 0.7171 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.070898.
6.849
Gesamtkosten
~$0.071Nur geschätzte GPU-Stromkosten. Der übrige Computer und die Anschaffungskosten der Hardware sind nicht enthalten. NVIDIA GeForce RTX 3090: 0.7171 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.070898.
$1.623
Eingabepreis
k. A.Eingabepreis…
$0.234 / 1MEingabepreis…
Ausgabepreis
k. A.Ausgabepreis…
$4.400 / 1MAusgabepreis…
Gesamte Eingabe-Token
99,705Gesamte Eingabe-Token…
83,822Gesamte Eingabe-Token…
Ausgabe-Token
1,545Ausgabe-Token…
72,040Ausgabe-Token…
Denk-Token
167,784Denk-Token…
292,615Denk-Token…
Antwortzeit (Durchschnitt)
39.11sAntwortzeit (Durchschnitt)…
69.86sAntwortzeit (Durchschnitt)…
Antwortzeit (Maximum)
376.04sAntwortzeit (Maximum)…
599.43sAntwortzeit (Maximum)…
Antwortzeit (Gesamt)
860.51sAntwortzeit (Gesamt)…
1536.98sAntwortzeit (Gesamt)…
Parameter
27.3B
744B insgesamt (40B aktiv)
Verfügbarkeit
Gewichte verfügbar
Open Source
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#101 Qwen3.8 27B
lowDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
Kosten
~$0.003Nur geschätzte GPU-Stromkosten. Der übrige Computer und die Anschaffungskosten der Hardware sind nicht enthalten. NVIDIA GeForce RTX 3090: 0.0258 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.002549.
Zeit
92.8s
Token
6,902 tok
#94 GLM 5.2
high
Reached the allocated time limit (300 seconds) without receiving showcase output.
Kosten
$0.000
Zeit
300.0s
Token
0 tok
Rang
-
Kosten
-
Zeit
-
Token
-
Top-Modelle nach Score
Score vs. Gesamtkosten
Antwortzeit (Durchschnitt)
Punktzahl vs Antwortzeit (Durchschnitt)
Gesamte Ausgabe-Token
Punktzahl vs Gesamte Ausgabe-Token
Kategorieaufschlüsselung
Anti-KI-Tricks
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)3.02sAntwortzeit (Maximum)5.68sAntwortzeit (Gesamt)12.07sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)5.80sAntwortzeit (Maximum)7.00sAntwortzeit (Gesamt)23.18sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
5.80sAntwortzeit (Durchschnitt)…
639Gesamte Eingabe-Token…
406Ausgabe-Token…
2,660Denk-Token…
Programmierung
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
7.7Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine Antwort: 1Antwortzeit (Durchschnitt)140.92sAntwortzeit (Maximum)376.04sAntwortzeit (Gesamt)422.75sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
8.6Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Zeitüberschreitung: 2Antwortzeit (Durchschnitt)73.03sAntwortzeit (Maximum)129.73sAntwortzeit (Gesamt)219.09sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
73.03sAntwortzeit (Durchschnitt)…
5,124Gesamte Eingabe-Token…
2,302Ausgabe-Token…
22,546Denk-Token…
Kombiniert
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)90.63sAntwortzeit (Maximum)143.71sAntwortzeit (Gesamt)181.27sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)321.47sAntwortzeit (Maximum)599.43sAntwortzeit (Gesamt)642.94sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
321.47sAntwortzeit (Durchschnitt)…
61,516Gesamte Eingabe-Token…
18,824Ausgabe-Token…
63,861Denk-Token…
Datenanalyse und -extraktion
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)8.03sAntwortzeit (Maximum)9.09sAntwortzeit (Gesamt)16.06sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)5.81sAntwortzeit (Maximum)9.80sAntwortzeit (Gesamt)11.62sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
5.81sAntwortzeit (Durchschnitt)…
7,143Gesamte Eingabe-Token…
435Ausgabe-Token…
1,414Denk-Token…
Domänenspezifisch
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
5.3Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 2Antwortzeit (Durchschnitt)60.78sAntwortzeit (Maximum)120.94sAntwortzeit (Gesamt)182.34sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
6.5Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
11.1%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine Antwort: 2Zeitüberschreitung: 1Antwortzeit (Durchschnitt)126.85sAntwortzeit (Maximum)180.69sAntwortzeit (Gesamt)380.54sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
126.85sAntwortzeit (Durchschnitt)…
560Gesamte Eingabe-Token…
49,045Ausgabe-Token…
157,522Denk-Token…
Allgemeine Intelligenz
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
5.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 1Antwortzeit (Durchschnitt)5.37sAntwortzeit (Maximum)5.37sAntwortzeit (Gesamt)5.37sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)12.90sAntwortzeit (Maximum)12.90sAntwortzeit (Gesamt)12.90sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
12.90sAntwortzeit (Durchschnitt)…
498Gesamte Eingabe-Token…
63Ausgabe-Token…
1,743Denk-Token…
Befolgung von Anweisungen
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)2.43sAntwortzeit (Maximum)2.87sAntwortzeit (Gesamt)4.86sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)4.26sAntwortzeit (Maximum)5.88sAntwortzeit (Gesamt)8.52sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
4.26sAntwortzeit (Durchschnitt)…
678Gesamte Eingabe-Token…
151Ausgabe-Token…
1,210Denk-Token…
Rätsellösen
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
7.7Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)4.91sAntwortzeit (Maximum)8.81sAntwortzeit (Gesamt)14.74sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
4.6Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
2Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 1Falsche Antwort: 1Antwortzeit (Durchschnitt)33.71sAntwortzeit (Maximum)76.21sAntwortzeit (Gesamt)101.13sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
33.71sAntwortzeit (Durchschnitt)…
665Gesamte Eingabe-Token…
568Ausgabe-Token…
22,392Denk-Token…
Werkzeugaufrufe
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
3.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)8.42sAntwortzeit (Maximum)8.42sAntwortzeit (Gesamt)8.42sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)9.25sAntwortzeit (Maximum)9.25sAntwortzeit (Gesamt)9.25sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
9.25sAntwortzeit (Durchschnitt)…
6,861Gesamte Eingabe-Token…
246Ausgabe-Token…
503Denk-Token…
Allgemeinwissen
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
3.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine Antwort: 1Antwortzeit (Durchschnitt)12.64sAntwortzeit (Maximum)12.64sAntwortzeit (Gesamt)12.64sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)127.82sAntwortzeit (Maximum)127.82sAntwortzeit (Gesamt)127.82sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…