Qwen3.8 27B (medium) führt beim Durchschnittsscore mit 7.8 vs 7.7. Qwen3.8 27B (medium) hat die niedrigeren Benchmark-Kosten mit ~$0.058 vs $0.454. Qwen3.8 27B (medium) ist schneller mit 33.05s vs 92.50s, mit Erfolgsraten von 63.6% vs 66.7%.
Benchmarks aus AI BENCHY-Test-Suites generiert am:
2026-09-28
Verglichene Modelle
Rang
#108
Gesamte Ausgabe-Token
209,444
Antwortzeit (Durchschnitt)
92.50s
Gesamtkosten
$0.454
Die Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
Rang
#101
Gesamte Ausgabe-Token
136,162
Antwortzeit (Durchschnitt)
33.05s
Gesamtkosten
~$0.058Nur geschätzte GPU-Stromkosten. Der übrige Computer und die Anschaffungskosten der Hardware sind nicht enthalten. NVIDIA GeForce RTX 3090: 0.5784 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.057183.
Empfohlenes ModellQwen3.8 27B (medium)
Es hat hier die beste Punktzahl (7.8) und kostet etwa 7.9x weniger als DeepSeek V4 Pro (high).
Qwen3.8 27BQwen3.8 27BmediumDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.Veröffentlichung: 2026-08-14
Qwen3.8 27BQwen3.8 27BmediumDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.Veröffentlichung: 2026-08-14
Punktzahl
7.7Durchschnittswert über alle Benchmark-Tests.…
7.8Durchschnittswert über alle Benchmark-Tests.…
Rang
#108
#101
Zuverlässigkeit
10.0Erfolgswert beim ersten Versuch: 10.0 bedeutet keine wiederholbaren Ziel-API- oder Rate-Limit-Fehler vor erfolgreichen Aufrufen; erfasste Fehler senken den Wert.…
9.6Erfolgswert beim ersten Versuch: 10.0 bedeutet keine wiederholbaren Ziel-API- oder Rate-Limit-Fehler vor erfolgreichen Aufrufen; erfasste Fehler senken den Wert.…
Konsistenz
7.7Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
9.7Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
63.6%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
Instabile Tests
6Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Gesamtläufe
66Gesamtläufe…
66Gesamtläufe…
Kosten pro Ergebnis
2.251
~0.409Nur geschätzte GPU-Stromkosten. Der übrige Computer und die Anschaffungskosten der Hardware sind nicht enthalten. NVIDIA GeForce RTX 3090: 0.5784 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.057183.
Gesamtkosten
$0.454
~$0.058Nur geschätzte GPU-Stromkosten. Der übrige Computer und die Anschaffungskosten der Hardware sind nicht enthalten. NVIDIA GeForce RTX 3090: 0.5784 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.057183.
Eingabepreis
$0.956 / 1MEingabepreis…
k. A.Eingabepreis…
Ausgabepreis
$1.911 / 1MAusgabepreis…
k. A.Ausgabepreis…
Gesamte Eingabe-Token
90,757Gesamte Eingabe-Token…
98,266Gesamte Eingabe-Token…
Ausgabe-Token
22,928Ausgabe-Token…
1,861Ausgabe-Token…
Denk-Token
186,516Denk-Token…
134,301Denk-Token…
Antwortzeit (Durchschnitt)
92.50sAntwortzeit (Durchschnitt)…
33.05sAntwortzeit (Durchschnitt)…
Antwortzeit (Maximum)
416.76sAntwortzeit (Maximum)…
214.63sAntwortzeit (Maximum)…
Antwortzeit (Gesamt)
2035.01sAntwortzeit (Gesamt)…
694.04sAntwortzeit (Gesamt)…
Parameter
1.6T insgesamt (49B aktiv)
27.3B
Verfügbarkeit
Open Source
Gewichte verfügbar
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#108 DeepSeek V4 Pro
high
Kosten
$0.023
Zeit
257.6s
Token
14,870 tok
#101 Qwen3.8 27B
mediumDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
Kosten
~$0.002Nur geschätzte GPU-Stromkosten. Der übrige Computer und die Anschaffungskosten der Hardware sind nicht enthalten. NVIDIA GeForce RTX 3090: 0.0121 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.001193.
5.9Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
58.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
2Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 2Keine Antwort: 1Antwortzeit (Durchschnitt)25.70sAntwortzeit (Maximum)48.19sAntwortzeit (Gesamt)102.80sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
25.70sAntwortzeit (Durchschnitt)…
536Gesamte Eingabe-Token…
149Ausgabe-Token…
3,214Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)2.93sAntwortzeit (Maximum)5.18sAntwortzeit (Gesamt)11.70sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
8.7Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.API-Fehler: 1Zeitüberschreitung: 1Antwortzeit (Durchschnitt)243.00sAntwortzeit (Maximum)416.76sAntwortzeit (Gesamt)729.00sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
243.00sAntwortzeit (Durchschnitt)…
5,090Gesamte Eingabe-Token…
383Ausgabe-Token…
84,580Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)40.50sAntwortzeit (Maximum)72.14sAntwortzeit (Gesamt)121.51sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)78.99sAntwortzeit (Maximum)119.80sAntwortzeit (Gesamt)157.97sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
78.99sAntwortzeit (Durchschnitt)…
66,082Gesamte Eingabe-Token…
4,582Ausgabe-Token…
25,404Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
8.7Durchschnittswert über alle Benchmark-Tests.…
6.9Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
83.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Ungültiger Werkzeugaufruf: 1Antwortzeit (Durchschnitt)124.48sAntwortzeit (Maximum)214.63sAntwortzeit (Gesamt)248.96sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)25.03sAntwortzeit (Maximum)27.49sAntwortzeit (Gesamt)50.06sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
25.03sAntwortzeit (Durchschnitt)…
7,690Gesamte Eingabe-Token…
274Ausgabe-Token…
2,166Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
6.5Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
50.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)8.76sAntwortzeit (Maximum)10.36sAntwortzeit (Gesamt)17.53sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
7.2Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
22.2%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 3Antwortzeit (Durchschnitt)249.47sAntwortzeit (Maximum)387.23sAntwortzeit (Gesamt)748.42sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
249.47sAntwortzeit (Durchschnitt)…
578Gesamte Eingabe-Token…
16,870Ausgabe-Token…
58,188Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
5.3Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 2Antwortzeit (Durchschnitt)76.98sAntwortzeit (Maximum)144.07sAntwortzeit (Gesamt)230.93sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)8.83sAntwortzeit (Maximum)8.83sAntwortzeit (Gesamt)8.83sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
8.83sAntwortzeit (Durchschnitt)…
471Gesamte Eingabe-Token…
115Ausgabe-Token…
1,013Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
5.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 1Antwortzeit (Durchschnitt)9.20sAntwortzeit (Maximum)9.20sAntwortzeit (Gesamt)9.20sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
6.6Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
83.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 1Antwortzeit (Durchschnitt)8.73sAntwortzeit (Maximum)9.53sAntwortzeit (Gesamt)17.45sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
8.73sAntwortzeit (Durchschnitt)…
627Gesamte Eingabe-Token…
66Ausgabe-Token…
2,726Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)2.54sAntwortzeit (Maximum)2.67sAntwortzeit (Gesamt)5.07sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
4.9Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
77.8%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
2Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 1Falsche Antwort: 1Antwortzeit (Durchschnitt)56.85sAntwortzeit (Maximum)146.68sAntwortzeit (Gesamt)170.55sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
56.85sAntwortzeit (Durchschnitt)…
591Gesamte Eingabe-Token…
178Ausgabe-Token…
2,563Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
8.3Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 1Antwortzeit (Durchschnitt)12.62sAntwortzeit (Maximum)29.62sAntwortzeit (Gesamt)37.85sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)15.92sAntwortzeit (Maximum)15.92sAntwortzeit (Gesamt)15.92sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
15.92sAntwortzeit (Durchschnitt)…
8,909Gesamte Eingabe-Token…
295Ausgabe-Token…
701Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
3.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.API-Fehler: 1Antwortzeit (Durchschnitt)0msAntwortzeit (Maximum)0msAntwortzeit (Gesamt)0msEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)34.01sAntwortzeit (Maximum)34.01sAntwortzeit (Gesamt)34.01sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
34.01sAntwortzeit (Durchschnitt)…
183Gesamte Eingabe-Token…
16Ausgabe-Token…
5,961Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
3.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine Antwort: 1Antwortzeit (Durchschnitt)11.29sAntwortzeit (Maximum)11.29sAntwortzeit (Gesamt)11.29sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…