Qwen3.8 27B führt beim Durchschnittsscore mit 5.5 vs 5.4. Die Kosten der lokalen Hardware wurden nicht gemessen. Daher ist kein Kostenvergleich möglich. GPT-5.6 Luna ist schneller mit 1.50s vs 3.12s, mit Erfolgsraten von 36.4% vs 40.9%.
Benchmarks aus AI BENCHY-Test-Suites generiert am:
2026-08-15
Rang
#216
Gesamte Ausgabe-Token
6,709
Antwortzeit (Durchschnitt)
1.50s
Gesamtkosten
$0.015
Rang
#211
Gesamte Ausgabe-Token
11,445
Antwortzeit (Durchschnitt)
3.12s
Gesamtkosten
k. A.
Empfohlenes ModellGPT-5.6 Luna
Die Punktzahl bleibt nah an der besten hier (5.4 vs 5.5) und es antwortet etwa 2.1x schneller als Qwen3.8 27B.
Qwen3.8 27BQwen3.8 27BnoneDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.Veröffentlichung: 2026-08-14
Qwen3.8 27BQwen3.8 27BnoneDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.Veröffentlichung: 2026-08-14
Punktzahl
5.4Durchschnittswert über alle Benchmark-Tests.…
5.5Durchschnittswert über alle Benchmark-Tests.…
Rang
#216
#211
Zuverlässigkeit
10.0Erfolgswert beim ersten Versuch: 10.0 bedeutet keine wiederholbaren Ziel-API- oder Rate-Limit-Fehler vor erfolgreichen Aufrufen; erfasste Fehler senken den Wert.…
10.0Erfolgswert beim ersten Versuch: 10.0 bedeutet keine wiederholbaren Ziel-API- oder Rate-Limit-Fehler vor erfolgreichen Aufrufen; erfasste Fehler senken den Wert.…
Konsistenz
8.8Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
Versuche
66/66
66/66
Korrekte Tests
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 14Zusätzliche Formatierung: 1Ungültiger Werkzeugaufruf: 1Antwortzeit (Durchschnitt)1.50sAntwortzeit (Maximum)10.57sAntwortzeit (Gesamt)33.05sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 11Anweisungen nicht befolgt: 1Ungültiger Werkzeugaufruf: 1Antwortzeit (Durchschnitt)3.12sAntwortzeit (Maximum)44.76sAntwortzeit (Gesamt)68.69sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
Erfolgsquote pro Versuch
36.4%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
40.9%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
Instabile Tests
3Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Gesamtläufe
66Gesamtläufe…
66Gesamtläufe…
Kosten pro Ergebnis
2.357Zeigt die durchschnittlichen Kosten pro korrekter Benchmark-Antwort in Cent an (niedriger ist besser).…
k. A.Zeigt die durchschnittlichen Kosten pro korrekter Benchmark-Antwort in Cent an (niedriger ist besser).…
Gesamtkosten
$0.015Gesamtkosten (aktueller Preis)…
k. A.Gesamtkosten (aktueller Preis)…
Eingabepreis
$0.100 / 1MEingabepreis…
k. A.Eingabepreis…
Ausgabepreis
$0.600 / 1MAusgabepreis…
k. A.Ausgabepreis…
Gesamte Eingabe-Token
101,332Gesamte Eingabe-Token…
122,463Gesamte Eingabe-Token…
Ausgabe-Token
6,709Ausgabe-Token…
11,445Ausgabe-Token…
Denk-Token
0Denk-Token…
0Denk-Token…
Antwortzeit (Durchschnitt)
1.50sAntwortzeit (Durchschnitt)…
3.12sAntwortzeit (Durchschnitt)…
Antwortzeit (Maximum)
10.57sAntwortzeit (Maximum)…
44.76sAntwortzeit (Maximum)…
Antwortzeit (Gesamt)
33.05sAntwortzeit (Gesamt)…
68.69sAntwortzeit (Gesamt)…
Parameter
~400B insgesamt (~17B aktiv)
27.3B
Verfügbarkeit
Geschlossen
Gewichte verfügbar
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#216 GPT-5.6 Luna
none
Kosten
$0.016
Zeit
15.8s
Token
2,685 tok
#211 Qwen3.8 27B
noneDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
25.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 3Antwortzeit (Durchschnitt)901msAntwortzeit (Maximum)1.45sAntwortzeit (Gesamt)3.60sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
901msAntwortzeit (Durchschnitt)…
606Gesamte Eingabe-Token…
266Ausgabe-Token…
0Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
6.5Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
50.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 2Antwortzeit (Durchschnitt)828msAntwortzeit (Maximum)1.95sAntwortzeit (Gesamt)3.31sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
7.2Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
22.2%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 3Antwortzeit (Durchschnitt)980msAntwortzeit (Maximum)1.57sAntwortzeit (Gesamt)2.94sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
980msAntwortzeit (Durchschnitt)…
7,302Gesamte Eingabe-Token…
459Ausgabe-Token…
0Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
5.5Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 2Antwortzeit (Durchschnitt)1.19sAntwortzeit (Maximum)1.97sAntwortzeit (Gesamt)3.56sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
9.1Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Ungültiger Werkzeugaufruf: 1Falsche Antwort: 1Antwortzeit (Durchschnitt)6.68sAntwortzeit (Maximum)10.57sAntwortzeit (Gesamt)13.35sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
6.68sAntwortzeit (Durchschnitt)…
78,124Gesamte Eingabe-Token…
5,022Ausgabe-Token…
0Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
3.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Ungültiger Werkzeugaufruf: 1Falsche Antwort: 1Antwortzeit (Durchschnitt)24.10sAntwortzeit (Maximum)44.76sAntwortzeit (Gesamt)48.21sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)758msAntwortzeit (Maximum)803msAntwortzeit (Gesamt)1.52sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
758msAntwortzeit (Durchschnitt)…
7,140Gesamte Eingabe-Token…
222Ausgabe-Token…
0Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
6.5Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
50.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)1.14sAntwortzeit (Maximum)1.18sAntwortzeit (Gesamt)2.27sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
7.2Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
22.2%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 3Antwortzeit (Durchschnitt)784msAntwortzeit (Maximum)855msAntwortzeit (Gesamt)2.35sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
784msAntwortzeit (Durchschnitt)…
732Gesamte Eingabe-Token…
54Ausgabe-Token…
0Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
7.7Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)552msAntwortzeit (Maximum)675msAntwortzeit (Gesamt)1.66sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)1.00sAntwortzeit (Maximum)1.00sAntwortzeit (Gesamt)1.00sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
1.00sAntwortzeit (Durchschnitt)…
477Gesamte Eingabe-Token…
150Ausgabe-Token…
0Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
4.2Durchschnittswert über alle Benchmark-Tests.…
9.9Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)1.31sAntwortzeit (Maximum)1.31sAntwortzeit (Gesamt)1.31sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
5.8Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
83.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)1.23sAntwortzeit (Maximum)1.66sAntwortzeit (Gesamt)2.47sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
1.23sAntwortzeit (Durchschnitt)…
660Gesamte Eingabe-Token…
86Ausgabe-Token…
0Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
6.3Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
50.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)582msAntwortzeit (Maximum)633msAntwortzeit (Gesamt)1.16sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Zusätzliche Formatierung: 1Falsche Antwort: 1Antwortzeit (Durchschnitt)790msAntwortzeit (Maximum)865msAntwortzeit (Gesamt)2.37sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
790msAntwortzeit (Durchschnitt)…
642Gesamte Eingabe-Token…
202Ausgabe-Token…
0Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
6.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 1Falsche Antwort: 1Antwortzeit (Durchschnitt)1.25sAntwortzeit (Maximum)1.84sAntwortzeit (Gesamt)3.76sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)2.80sAntwortzeit (Maximum)2.80sAntwortzeit (Gesamt)2.80sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
2.80sAntwortzeit (Durchschnitt)…
5,454Gesamte Eingabe-Token…
222Ausgabe-Token…
0Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)2.75sAntwortzeit (Maximum)2.75sAntwortzeit (Gesamt)2.75sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)651msAntwortzeit (Maximum)651msAntwortzeit (Gesamt)651msEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
651msAntwortzeit (Durchschnitt)…
195Gesamte Eingabe-Token…
26Ausgabe-Token…
0Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
3.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)703msAntwortzeit (Maximum)703msAntwortzeit (Gesamt)703msEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…