Qwen3.8 27B führt beim Durchschnittsscore mit 5.4 vs 5.4. Qwen3.8 27B hat die niedrigeren Benchmark-Kosten mit ~$0.010 vs $0.105. Qwen3.8 27B ist schneller mit 5.05s vs 190.48s, mit Erfolgsraten von 39.1% vs 49.3%.
Benchmarks aus AI BENCHY-Test-Suites generiert am:
2026-10-01
Verglichene Modelle
Die Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
Rang
#272
Gesamte Ausgabe-Token
13,791
Antwortzeit (Durchschnitt)
5.05s
Gesamtkosten
~$0.010Nur geschätzte GPU-Stromkosten. Der übrige Computer und die Anschaffungskosten der Hardware sind nicht enthalten. NVIDIA GeForce RTX 3090: 0.0968 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.009566.
Rang
#276
Gesamte Ausgabe-Token
607,130
Antwortzeit (Durchschnitt)
190.48s
Gesamtkosten
$0.105
Empfohlenes ModellQwen3.8 27B
Es hat hier die beste Punktzahl (5.4) und kostet etwa 10.9x weniger als Step 3.5 Flash (medium).
Detaillierter Vergleich
Metrik
Qwen3.8 27BQwen3.8 27BnoneDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.Veröffentlichung: 2026-08-14Kostenlos verfügbar
Qwen3.8 27BQwen3.8 27BnoneDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.Veröffentlichung: 2026-08-14Kostenlos verfügbar
10.0Erfolgswert beim ersten Versuch: 10.0 bedeutet keine wiederholbaren Ziel-API- oder Rate-Limit-Fehler vor erfolgreichen Aufrufen; erfasste Fehler senken den Wert.…
10.0Erfolgswert beim ersten Versuch: 10.0 bedeutet keine wiederholbaren Ziel-API- oder Rate-Limit-Fehler vor erfolgreichen Aufrufen; erfasste Fehler senken den Wert.…
Konsistenz
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
8.3Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
Versuche
69/69
66/69
Korrekte Tests
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 12Anweisungen nicht befolgt: 1Ungültiger Werkzeugaufruf: 1Antwortzeit (Durchschnitt)5.05sAntwortzeit (Maximum)47.42sAntwortzeit (Gesamt)116.11sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
39.1%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
49.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
Instabile Tests
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
3Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Gesamtläufe
69Gesamtläufe…
66Gesamtläufe…
Kosten pro Ergebnis
~0.107Nur geschätzte GPU-Stromkosten. Der übrige Computer und die Anschaffungskosten der Hardware sind nicht enthalten. NVIDIA GeForce RTX 3090: 0.0968 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.009566.
1.047
Gesamtkosten
~$0.010Nur geschätzte GPU-Stromkosten. Der übrige Computer und die Anschaffungskosten der Hardware sind nicht enthalten. NVIDIA GeForce RTX 3090: 0.0968 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.009566.
$0.105
Eingabepreis
k. A.Eingabepreis…
$0.100 / 1MEingabepreis…
Ausgabepreis
k. A.Ausgabepreis…
$0.300 / 1MAusgabepreis…
Gesamte Eingabe-Token
281,460Gesamte Eingabe-Token…
139,086Gesamte Eingabe-Token…
Ausgabe-Token
13,791Ausgabe-Token…
193,584Ausgabe-Token…
Denk-Token
0Denk-Token…
413,546Denk-Token…
Antwortzeit (Durchschnitt)
5.05sAntwortzeit (Durchschnitt)…
190.48sAntwortzeit (Durchschnitt)…
Antwortzeit (Maximum)
47.42sAntwortzeit (Maximum)…
1597.85sAntwortzeit (Maximum)…
Antwortzeit (Gesamt)
116.11sAntwortzeit (Gesamt)…
3238.23sAntwortzeit (Gesamt)…
Parameter
27.3B
196B insgesamt (11B aktiv)
Verfügbarkeit
Gewichte verfügbar
Open Source
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#272 Qwen3.8 27B
noneDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
Kosten
~$0.001Nur geschätzte GPU-Stromkosten. Der übrige Computer und die Anschaffungskosten der Hardware sind nicht enthalten. NVIDIA GeForce RTX 3090: 0.0066 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.000657.
Zeit
23.9s
Token
1,922 tok
#276 Step 3.5 Flash
medium
Kosten
$0.008
Zeit
277.1s
Token
23,695 tok
Rang
-
Kosten
-
Zeit
-
Token
-
Top-Modelle nach Score
Score vs. Gesamtkosten
Antwortzeit (Durchschnitt)
Punktzahl vs Antwortzeit (Durchschnitt)
Gesamte Ausgabe-Token
Punktzahl vs Gesamte Ausgabe-Token
Kategorieaufschlüsselung
Agentenaufgaben
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
5.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)47.42sAntwortzeit (Maximum)47.42sAntwortzeit (Gesamt)47.42sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
1.6Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)172.16sAntwortzeit (Maximum)172.16sAntwortzeit (Gesamt)172.16sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
172.16sAntwortzeit (Durchschnitt)…
73,370Gesamte Eingabe-Token…
4,160Ausgabe-Token…
34,434Denk-Token…
Anti-KI-Tricks
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
6.5Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
50.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 2Antwortzeit (Durchschnitt)828msAntwortzeit (Maximum)1.95sAntwortzeit (Gesamt)3.31sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)40.57sAntwortzeit (Maximum)110.43sAntwortzeit (Gesamt)121.72sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
40.57sAntwortzeit (Durchschnitt)…
694Gesamte Eingabe-Token…
20,391Ausgabe-Token…
24,176Denk-Token…
Programmierung
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
5.5Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 2Antwortzeit (Durchschnitt)1.19sAntwortzeit (Maximum)1.97sAntwortzeit (Gesamt)3.56sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
5.2Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine Antwort: 1Zeitüberschreitung: 1Antwortzeit (Durchschnitt)258.38sAntwortzeit (Maximum)453.94sAntwortzeit (Gesamt)516.77sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
258.38sAntwortzeit (Durchschnitt)…
2,211Gesamte Eingabe-Token…
13,207Ausgabe-Token…
22,429Denk-Token…
Kombiniert
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
3.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Ungültiger Werkzeugaufruf: 1Falsche Antwort: 1Antwortzeit (Durchschnitt)24.10sAntwortzeit (Maximum)44.76sAntwortzeit (Gesamt)48.21sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
50.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.API-Fehler: 1Antwortzeit (Durchschnitt)813.71sAntwortzeit (Maximum)1597.85sAntwortzeit (Gesamt)1627.41sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
813.71sAntwortzeit (Durchschnitt)…
44,914Gesamte Eingabe-Token…
18,150Ausgabe-Token…
111,004Denk-Token…
Datenanalyse und -extraktion
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
6.5Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
50.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)1.14sAntwortzeit (Maximum)1.18sAntwortzeit (Gesamt)2.27sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)15.01sAntwortzeit (Maximum)15.01sAntwortzeit (Gesamt)15.01sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
15.01sAntwortzeit (Durchschnitt)…
7,368Gesamte Eingabe-Token…
600Ausgabe-Token…
13,886Denk-Token…
Domänenspezifisch
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
7.7Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)552msAntwortzeit (Maximum)675msAntwortzeit (Gesamt)1.66sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
4.4Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
2Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 3Antwortzeit (Durchschnitt)311.60sAntwortzeit (Maximum)452.75sAntwortzeit (Gesamt)623.20sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
311.60sAntwortzeit (Durchschnitt)…
682Gesamte Eingabe-Token…
126,213Ausgabe-Token…
175,555Denk-Token…
Allgemeine Intelligenz
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
4.2Durchschnittswert über alle Benchmark-Tests.…
9.9Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)1.31sAntwortzeit (Maximum)1.31sAntwortzeit (Gesamt)1.31sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 1Antwortzeit (Durchschnitt)22.39sAntwortzeit (Maximum)22.39sAntwortzeit (Gesamt)22.39sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
22.39sAntwortzeit (Durchschnitt)…
509Gesamte Eingabe-Token…
240Ausgabe-Token…
3,506Denk-Token…
Befolgung von Anweisungen
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
6.3Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
50.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)582msAntwortzeit (Maximum)633msAntwortzeit (Gesamt)1.16sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
50.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 1Antwortzeit (Durchschnitt)4.78sAntwortzeit (Maximum)4.78sAntwortzeit (Gesamt)4.78sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
4.78sAntwortzeit (Durchschnitt)…
705Gesamte Eingabe-Token…
2,364Ausgabe-Token…
3,521Denk-Token…
Rätsellösen
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
6.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 1Falsche Antwort: 1Antwortzeit (Durchschnitt)1.25sAntwortzeit (Maximum)1.84sAntwortzeit (Gesamt)3.76sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 1Falsche Antwort: 1Antwortzeit (Durchschnitt)7.22sAntwortzeit (Maximum)10.60sAntwortzeit (Gesamt)14.44sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
7.22sAntwortzeit (Durchschnitt)…
711Gesamte Eingabe-Token…
5,630Ausgabe-Token…
10,861Denk-Token…
Werkzeugaufrufe
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)2.75sAntwortzeit (Maximum)2.75sAntwortzeit (Gesamt)2.75sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)11.91sAntwortzeit (Maximum)11.91sAntwortzeit (Gesamt)11.91sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
11.91sAntwortzeit (Durchschnitt)…
7,701Gesamte Eingabe-Token…
275Ausgabe-Token…
3,802Denk-Token…
Allgemeinwissen
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
3.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)703msAntwortzeit (Maximum)703msAntwortzeit (Gesamt)703msEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)108.45sAntwortzeit (Maximum)108.45sAntwortzeit (Gesamt)108.45sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…