Qwen3.8 27B (high) führt beim Durchschnittsscore mit 8.7 vs 8.6. Qwen3.8 27B (high) hat die niedrigeren Benchmark-Kosten mit ~$0.298 vs $1.516. Claude Sonnet 5.5 (xhigh) ist schneller mit 14.98s vs 166.34s, mit Erfolgsraten von 79.7% vs 78.3%.
Benchmarks aus AI BENCHY-Test-Suites generiert am:
2026-10-01
Verglichene Modelle
Rang
#61
Gesamte Ausgabe-Token
83,041
Antwortzeit (Durchschnitt)
14.98s
Gesamtkosten
$1.516
Die Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
Rang
#55
Gesamte Ausgabe-Token
677,080
Antwortzeit (Durchschnitt)
166.34s
Gesamtkosten
~$0.298Nur geschätzte GPU-Stromkosten. Der übrige Computer und die Anschaffungskosten der Hardware sind nicht enthalten. NVIDIA GeForce RTX 3090: 3.0102 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.297613.
Empfohlenes ModellQwen3.8 27B (high)
Es hat hier die beste Punktzahl (8.7) und kostet etwa 5.1x weniger als Claude Sonnet 5.5 (xhigh).
Qwen3.8 27BQwen3.8 27BhighDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.Veröffentlichung: 2026-08-14Kostenlos verfügbar
Qwen3.8 27BQwen3.8 27BhighDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.Veröffentlichung: 2026-08-14Kostenlos verfügbar
Punktzahl
8.6Durchschnittswert über alle Benchmark-Tests.…
8.7Durchschnittswert über alle Benchmark-Tests.…
Rang
#61
#55
Zuverlässigkeit
10.0Erfolgswert beim ersten Versuch: 10.0 bedeutet keine wiederholbaren Ziel-API- oder Rate-Limit-Fehler vor erfolgreichen Aufrufen; erfasste Fehler senken den Wert.…
9.7Erfolgswert beim ersten Versuch: 10.0 bedeutet keine wiederholbaren Ziel-API- oder Rate-Limit-Fehler vor erfolgreichen Aufrufen; erfasste Fehler senken den Wert.…
Konsistenz
8.7Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
9.2Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 2Keine Antwort: 2Falsche Antwort: 2Antwortzeit (Durchschnitt)166.34sAntwortzeit (Maximum)640.85sAntwortzeit (Gesamt)3825.81sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
Erfolgsquote pro Versuch
79.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
78.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
Instabile Tests
4Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
2Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Gesamtläufe
69Gesamtläufe…
69Gesamtläufe…
Kosten pro Ergebnis
9.473
~1.751Nur geschätzte GPU-Stromkosten. Der übrige Computer und die Anschaffungskosten der Hardware sind nicht enthalten. NVIDIA GeForce RTX 3090: 3.0102 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.297613.
Gesamtkosten
$1.516
~$0.298Nur geschätzte GPU-Stromkosten. Der übrige Computer und die Anschaffungskosten der Hardware sind nicht enthalten. NVIDIA GeForce RTX 3090: 3.0102 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.297613.
Eingabepreis
$2.000 / 1MEingabepreis…
k. A.Eingabepreis…
Ausgabepreis
$10.000 / 1MAusgabepreis…
k. A.Ausgabepreis…
Gesamte Eingabe-Token
342,579Gesamte Eingabe-Token…
348,967Gesamte Eingabe-Token…
Ausgabe-Token
12,848Ausgabe-Token…
1,005Ausgabe-Token…
Denk-Token
70,193Denk-Token…
676,075Denk-Token…
Antwortzeit (Durchschnitt)
14.98sAntwortzeit (Durchschnitt)…
166.34sAntwortzeit (Durchschnitt)…
Antwortzeit (Maximum)
54.92sAntwortzeit (Maximum)…
640.85sAntwortzeit (Maximum)…
Antwortzeit (Gesamt)
344.60sAntwortzeit (Gesamt)…
3825.81sAntwortzeit (Gesamt)…
Parameter
~1T insgesamt (~100B aktiv)
27.3B
Verfügbarkeit
Geschlossen
Gewichte verfügbar
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#61 Claude Sonnet 5.5
xhigh
Kosten
$0.319
Zeit
258.6s
Token
31,969 tok
#55 Qwen3.8 27B
highDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
Kosten
~$0.008Nur geschätzte GPU-Stromkosten. Der übrige Computer und die Anschaffungskosten der Hardware sind nicht enthalten. NVIDIA GeForce RTX 3090: 0.0750 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.007419.
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)54.92sAntwortzeit (Maximum)54.92sAntwortzeit (Gesamt)54.92sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
54.92sAntwortzeit (Durchschnitt)…
193,936Gesamte Eingabe-Token…
3,148Ausgabe-Token…
2,788Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)132.27sAntwortzeit (Maximum)132.27sAntwortzeit (Gesamt)132.27sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)4.21sAntwortzeit (Maximum)5.12sAntwortzeit (Gesamt)16.83sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
4.21sAntwortzeit (Durchschnitt)…
858Gesamte Eingabe-Token…
417Ausgabe-Token…
1,162Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)8.10sAntwortzeit (Maximum)21.48sAntwortzeit (Gesamt)32.40sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
7.2Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
88.9%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Zusätzliche Formatierung: 1Antwortzeit (Durchschnitt)11.90sAntwortzeit (Maximum)15.48sAntwortzeit (Gesamt)35.70sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
11.90sAntwortzeit (Durchschnitt)…
10,608Gesamte Eingabe-Token…
555Ausgabe-Token…
9,501Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
8.1Durchschnittswert über alle Benchmark-Tests.…
7.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
88.9%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 1Antwortzeit (Durchschnitt)248.62sAntwortzeit (Maximum)458.25sAntwortzeit (Gesamt)745.85sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
6.9Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
83.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Ungültiger Werkzeugaufruf: 1Antwortzeit (Durchschnitt)30.37sAntwortzeit (Maximum)37.90sAntwortzeit (Gesamt)60.75sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
30.37sAntwortzeit (Durchschnitt)…
111,104Gesamte Eingabe-Token…
6,732Ausgabe-Token…
10,690Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)185.57sAntwortzeit (Maximum)333.21sAntwortzeit (Gesamt)371.15sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)4.96sAntwortzeit (Maximum)6.16sAntwortzeit (Gesamt)9.92sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
4.96sAntwortzeit (Durchschnitt)…
10,515Gesamte Eingabe-Token…
312Ausgabe-Token…
1,590Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)34.85sAntwortzeit (Maximum)57.71sAntwortzeit (Gesamt)69.71sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
7.2Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
11.1%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 3Antwortzeit (Durchschnitt)35.33sAntwortzeit (Maximum)54.91sAntwortzeit (Gesamt)106.00sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
35.33sAntwortzeit (Durchschnitt)…
990Gesamte Eingabe-Token…
56Ausgabe-Token…
34,319Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
5.3Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine Antwort: 1Falsche Antwort: 1Antwortzeit (Durchschnitt)526.74sAntwortzeit (Maximum)640.85sAntwortzeit (Gesamt)1580.21sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
3.4Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 1Antwortzeit (Durchschnitt)9.10sAntwortzeit (Maximum)9.10sAntwortzeit (Gesamt)9.10sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
9.10sAntwortzeit (Durchschnitt)…
714Gesamte Eingabe-Token…
279Ausgabe-Token…
2,152Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
5.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 1Antwortzeit (Durchschnitt)8.45sAntwortzeit (Maximum)8.45sAntwortzeit (Gesamt)8.45sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)4.58sAntwortzeit (Maximum)4.79sAntwortzeit (Gesamt)9.15sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
4.58sAntwortzeit (Durchschnitt)…
921Gesamte Eingabe-Token…
98Ausgabe-Token…
661Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
9.8Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)8.24sAntwortzeit (Maximum)10.18sAntwortzeit (Gesamt)16.49sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)4.88sAntwortzeit (Maximum)5.32sAntwortzeit (Gesamt)14.63sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
4.88sAntwortzeit (Durchschnitt)…
912Gesamte Eingabe-Token…
716Ausgabe-Token…
1,402Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
7.6Durchschnittswert über alle Benchmark-Tests.…
7.2Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
77.8%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine Antwort: 1Antwortzeit (Durchschnitt)199.90sAntwortzeit (Maximum)569.33sAntwortzeit (Gesamt)599.69sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)10.29sAntwortzeit (Maximum)10.29sAntwortzeit (Gesamt)10.29sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.29sAntwortzeit (Durchschnitt)…
11,757Gesamte Eingabe-Token…
354Ausgabe-Token…
1,112Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)5.62sAntwortzeit (Maximum)5.62sAntwortzeit (Gesamt)5.62sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine Antwort: 1Antwortzeit (Durchschnitt)17.31sAntwortzeit (Maximum)17.31sAntwortzeit (Gesamt)17.31sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
17.31sAntwortzeit (Durchschnitt)…
264Gesamte Eingabe-Token…
181Ausgabe-Token…
4,816Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
3.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)263.98sAntwortzeit (Maximum)263.98sAntwortzeit (Gesamt)263.98sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…