KAT-Coder-Air V2.5 (high) führt beim Durchschnittsscore mit 5.6 vs 5.5. Die Kosten der lokalen Hardware wurden nicht gemessen. Daher ist kein Kostenvergleich möglich. Qwen3.8 27B ist schneller mit 3.12s vs 15.87s, mit Erfolgsraten von 42.4% vs 40.9%.
Benchmarks aus AI BENCHY-Test-Suites generiert am:
2026-08-15
Rang
#201
Gesamte Ausgabe-Token
114,654
Antwortzeit (Durchschnitt)
15.87s
Gesamtkosten
$0.077
Rang
#211
Gesamte Ausgabe-Token
11,445
Antwortzeit (Durchschnitt)
3.12s
Gesamtkosten
k. A.
Empfohlenes ModellQwen3.8 27B
Die Punktzahl bleibt nah an der besten hier (5.5 vs 5.6) und es antwortet etwa 5.1x schneller als KAT-Coder-Air V2.5 (high).
Qwen3.8 27BQwen3.8 27BnoneDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.Veröffentlichung: 2026-08-14
Qwen3.8 27BQwen3.8 27BnoneDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.Veröffentlichung: 2026-08-14
Punktzahl
5.6Durchschnittswert über alle Benchmark-Tests.…
5.5Durchschnittswert über alle Benchmark-Tests.…
Rang
#201
#211
Zuverlässigkeit
9.8Erfolgswert beim ersten Versuch: 10.0 bedeutet keine wiederholbaren Ziel-API- oder Rate-Limit-Fehler vor erfolgreichen Aufrufen; erfasste Fehler senken den Wert.…
10.0Erfolgswert beim ersten Versuch: 10.0 bedeutet keine wiederholbaren Ziel-API- oder Rate-Limit-Fehler vor erfolgreichen Aufrufen; erfasste Fehler senken den Wert.…
Konsistenz
8.1Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
Versuche
66/66
66/66
Korrekte Tests
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 9API-Fehler: 3Zusätzliche Formatierung: 3Antwortzeit (Durchschnitt)15.87sAntwortzeit (Maximum)118.35sAntwortzeit (Gesamt)349.16sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 11Anweisungen nicht befolgt: 1Ungültiger Werkzeugaufruf: 1Antwortzeit (Durchschnitt)3.12sAntwortzeit (Maximum)44.76sAntwortzeit (Gesamt)68.69sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
Erfolgsquote pro Versuch
42.4%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
40.9%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
Instabile Tests
5Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Gesamtläufe
66Gesamtläufe…
66Gesamtläufe…
Kosten pro Ergebnis
1.091Zeigt die durchschnittlichen Kosten pro korrekter Benchmark-Antwort in Cent an (niedriger ist besser).…
k. A.Zeigt die durchschnittlichen Kosten pro korrekter Benchmark-Antwort in Cent an (niedriger ist besser).…
Gesamtkosten
$0.077Gesamtkosten (aktueller Preis)…
k. A.Gesamtkosten (aktueller Preis)…
Eingabepreis
$0.150 / 1MEingabepreis…
k. A.Eingabepreis…
Ausgabepreis
$0.600 / 1MAusgabepreis…
k. A.Ausgabepreis…
Gesamte Eingabe-Token
50,423Gesamte Eingabe-Token…
122,463Gesamte Eingabe-Token…
Ausgabe-Token
4,144Ausgabe-Token…
11,445Ausgabe-Token…
Denk-Token
110,510Denk-Token…
0Denk-Token…
Antwortzeit (Durchschnitt)
15.87sAntwortzeit (Durchschnitt)…
3.12sAntwortzeit (Durchschnitt)…
Antwortzeit (Maximum)
118.35sAntwortzeit (Maximum)…
44.76sAntwortzeit (Maximum)…
Antwortzeit (Gesamt)
349.16sAntwortzeit (Gesamt)…
68.69sAntwortzeit (Gesamt)…
Parameter
~35B insgesamt (~3B aktiv)
27.3B
Verfügbarkeit
Geschlossen
Gewichte verfügbar
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#201 KAT-Coder-Air V2.5
high
Ungültiges SVG
Kosten
$0.000
Zeit
300.0s
Token
0 tok
#211 Qwen3.8 27B
noneDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
5.8Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
75.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
2Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.API-Fehler: 1Falsche Antwort: 1Antwortzeit (Durchschnitt)2.49sAntwortzeit (Maximum)3.97sAntwortzeit (Gesamt)9.97sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
2.49sAntwortzeit (Durchschnitt)…
615Gesamte Eingabe-Token…
204Ausgabe-Token…
1,290Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
6.5Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
50.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 2Antwortzeit (Durchschnitt)828msAntwortzeit (Maximum)1.95sAntwortzeit (Gesamt)3.31sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
7.3Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
11.1%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.API-Fehler: 1Zusätzliche Formatierung: 1Falsche Antwort: 1Antwortzeit (Durchschnitt)39.07sAntwortzeit (Maximum)104.98sAntwortzeit (Gesamt)117.21sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
39.07sAntwortzeit (Durchschnitt)…
6,948Gesamte Eingabe-Token…
1,166Ausgabe-Token…
55,883Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
5.5Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 2Antwortzeit (Durchschnitt)1.19sAntwortzeit (Maximum)1.97sAntwortzeit (Gesamt)3.56sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
50.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.API-Fehler: 1Antwortzeit (Durchschnitt)74.48sAntwortzeit (Maximum)118.35sAntwortzeit (Gesamt)148.95sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
74.48sAntwortzeit (Durchschnitt)…
23,854Gesamte Eingabe-Token…
485Ausgabe-Token…
28,559Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
3.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Ungültiger Werkzeugaufruf: 1Falsche Antwort: 1Antwortzeit (Durchschnitt)24.10sAntwortzeit (Maximum)44.76sAntwortzeit (Gesamt)48.21sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
50.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)3.59sAntwortzeit (Maximum)4.92sAntwortzeit (Gesamt)7.18sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
3.59sAntwortzeit (Durchschnitt)…
7,776Gesamte Eingabe-Token…
284Ausgabe-Token…
2,140Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
6.5Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
50.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)1.14sAntwortzeit (Maximum)1.18sAntwortzeit (Gesamt)2.27sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Zusätzliche Formatierung: 2Falsche Antwort: 1Antwortzeit (Durchschnitt)7.28sAntwortzeit (Maximum)8.71sAntwortzeit (Gesamt)21.85sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
7.28sAntwortzeit (Durchschnitt)…
724Gesamte Eingabe-Token…
1,101Ausgabe-Token…
7,738Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
7.7Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)552msAntwortzeit (Maximum)675msAntwortzeit (Gesamt)1.66sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)7.10sAntwortzeit (Maximum)7.10sAntwortzeit (Gesamt)7.10sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
7.10sAntwortzeit (Durchschnitt)…
516Gesamte Eingabe-Token…
179Ausgabe-Token…
539Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
4.2Durchschnittswert über alle Benchmark-Tests.…
9.9Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)1.31sAntwortzeit (Maximum)1.31sAntwortzeit (Gesamt)1.31sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)1.51sAntwortzeit (Maximum)1.91sAntwortzeit (Gesamt)3.01sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
1.51sAntwortzeit (Durchschnitt)…
699Gesamte Eingabe-Token…
90Ausgabe-Token…
675Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
6.3Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
50.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)582msAntwortzeit (Maximum)633msAntwortzeit (Gesamt)1.16sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
4.4Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
2Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 3Antwortzeit (Durchschnitt)2.47sAntwortzeit (Maximum)2.86sAntwortzeit (Gesamt)7.40sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
2.47sAntwortzeit (Durchschnitt)…
696Gesamte Eingabe-Token…
285Ausgabe-Token…
1,576Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
6.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 1Falsche Antwort: 1Antwortzeit (Durchschnitt)1.25sAntwortzeit (Maximum)1.84sAntwortzeit (Gesamt)3.76sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)4.77sAntwortzeit (Maximum)4.77sAntwortzeit (Gesamt)4.77sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
4.77sAntwortzeit (Durchschnitt)…
8,391Gesamte Eingabe-Token…
330Ausgabe-Token…
1,082Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)2.75sAntwortzeit (Maximum)2.75sAntwortzeit (Gesamt)2.75sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)21.72sAntwortzeit (Maximum)21.72sAntwortzeit (Gesamt)21.72sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
21.72sAntwortzeit (Durchschnitt)…
204Gesamte Eingabe-Token…
20Ausgabe-Token…
11,028Denk-Token…
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
3.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)703msAntwortzeit (Maximum)703msAntwortzeit (Gesamt)703msEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…