Inkling (medium) führt beim Durchschnittsscore mit 8.0 vs 7.9. Qwen3.8 27B (low) hat die niedrigeren Benchmark-Kosten mit ~$0.071 vs $0.383. Inkling (medium) ist schneller mit 15.66s vs 39.11s, mit Erfolgsraten von 68.2% vs 75.8%.
Benchmarks aus AI BENCHY-Test-Suites generiert am:
2026-09-28
Verglichene Modelle
Die Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
Rang
#93
Gesamte Ausgabe-Token
169,329
Antwortzeit (Durchschnitt)
39.11s
Gesamtkosten
~$0.071Nur geschätzte GPU-Stromkosten. Der übrige Computer und die Anschaffungskosten der Hardware sind nicht enthalten. NVIDIA GeForce RTX 3090: 0.7171 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.070898.
Rang
#87
Gesamte Ausgabe-Token
63,842
Antwortzeit (Durchschnitt)
15.66s
Gesamtkosten
$0.383
Empfohlenes ModellQwen3.8 27B (low)
Die Punktzahl bleibt nah an der besten hier (7.9 vs 8.0) und es kostet etwa 5.4x weniger als Inkling (medium).
Detaillierter Vergleich
Metrik
Qwen3.8 27BQwen3.8 27BlowDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.Veröffentlichung: 2026-08-14
Qwen3.8 27BQwen3.8 27BlowDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.Veröffentlichung: 2026-08-14
10.0Erfolgswert beim ersten Versuch: 10.0 bedeutet keine wiederholbaren Ziel-API- oder Rate-Limit-Fehler vor erfolgreichen Aufrufen; erfasste Fehler senken den Wert.…
10.0Erfolgswert beim ersten Versuch: 10.0 bedeutet keine wiederholbaren Ziel-API- oder Rate-Limit-Fehler vor erfolgreichen Aufrufen; erfasste Fehler senken den Wert.…
Konsistenz
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
8.5Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
Versuche
66/66
66/66
Korrekte Tests
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 4Keine Antwort: 2Anweisungen nicht befolgt: 1Antwortzeit (Durchschnitt)39.11sAntwortzeit (Maximum)376.04sAntwortzeit (Gesamt)860.51sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 4API-Fehler: 1Ungültiger Werkzeugaufruf: 1Keine Antwort: 1Antwortzeit (Durchschnitt)15.66sAntwortzeit (Maximum)85.12sAntwortzeit (Gesamt)344.52sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
Erfolgsquote pro Versuch
68.2%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
75.8%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
Instabile Tests
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
4Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Gesamtläufe
66Gesamtläufe…
66Gesamtläufe…
Kosten pro Ergebnis
~0.473Nur geschätzte GPU-Stromkosten. Der übrige Computer und die Anschaffungskosten der Hardware sind nicht enthalten. NVIDIA GeForce RTX 3090: 0.7171 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.070898.
2.551
Gesamtkosten
~$0.071Nur geschätzte GPU-Stromkosten. Der übrige Computer und die Anschaffungskosten der Hardware sind nicht enthalten. NVIDIA GeForce RTX 3090: 0.7171 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.070898.
$0.383
Eingabepreis
k. A.Eingabepreis…
$1.000 / 1MEingabepreis…
Ausgabepreis
k. A.Ausgabepreis…
$4.050 / 1MAusgabepreis…
Gesamte Eingabe-Token
99,705Gesamte Eingabe-Token…
124,062Gesamte Eingabe-Token…
Ausgabe-Token
1,545Ausgabe-Token…
12,190Ausgabe-Token…
Denk-Token
167,784Denk-Token…
51,652Denk-Token…
Antwortzeit (Durchschnitt)
39.11sAntwortzeit (Durchschnitt)…
15.66sAntwortzeit (Durchschnitt)…
Antwortzeit (Maximum)
376.04sAntwortzeit (Maximum)…
85.12sAntwortzeit (Maximum)…
Antwortzeit (Gesamt)
860.51sAntwortzeit (Gesamt)…
344.52sAntwortzeit (Gesamt)…
Parameter
27.3B
975B insgesamt (41B aktiv)
Verfügbarkeit
Gewichte verfügbar
Open Source
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#93 Qwen3.8 27B
lowDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
Kosten
~$0.003Nur geschätzte GPU-Stromkosten. Der übrige Computer und die Anschaffungskosten der Hardware sind nicht enthalten. NVIDIA GeForce RTX 3090: 0.0258 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.002549.
Zeit
92.8s
Token
6,902 tok
#87 Thinking Machines: Inkling
medium
Kosten
$0.004
Zeit
11.2s
Token
852 tok
Rang
-
Kosten
-
Zeit
-
Token
-
Top-Modelle nach Score
Score vs. Gesamtkosten
Antwortzeit (Durchschnitt)
Punktzahl vs Antwortzeit (Durchschnitt)
Gesamte Ausgabe-Token
Punktzahl vs Gesamte Ausgabe-Token
Kategorieaufschlüsselung
Anti-KI-Tricks
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)3.02sAntwortzeit (Maximum)5.68sAntwortzeit (Gesamt)12.07sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
9.5Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
75.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.API-Fehler: 1Antwortzeit (Durchschnitt)6.49sAntwortzeit (Maximum)15.22sAntwortzeit (Gesamt)25.95sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
6.49sAntwortzeit (Durchschnitt)…
645Gesamte Eingabe-Token…
333Ausgabe-Token…
3,091Denk-Token…
Programmierung
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
7.7Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine Antwort: 1Antwortzeit (Durchschnitt)140.92sAntwortzeit (Maximum)376.04sAntwortzeit (Gesamt)422.75sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
7.8Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
77.8%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)25.20sAntwortzeit (Maximum)46.41sAntwortzeit (Gesamt)75.61sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
25.20sAntwortzeit (Durchschnitt)…
7,374Gesamte Eingabe-Token…
525Ausgabe-Token…
14,457Denk-Token…
Kombiniert
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)90.63sAntwortzeit (Maximum)143.71sAntwortzeit (Gesamt)181.27sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
5.8Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
83.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine Antwort: 1Antwortzeit (Durchschnitt)41.15sAntwortzeit (Maximum)74.33sAntwortzeit (Gesamt)82.31sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
41.15sAntwortzeit (Durchschnitt)…
98,542Gesamte Eingabe-Token…
10,088Ausgabe-Token…
4,626Denk-Token…
Datenanalyse und -extraktion
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)8.03sAntwortzeit (Maximum)9.09sAntwortzeit (Gesamt)16.06sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)3.60sAntwortzeit (Maximum)3.75sAntwortzeit (Gesamt)7.20sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
3.60sAntwortzeit (Durchschnitt)…
7,068Gesamte Eingabe-Token…
216Ausgabe-Token…
813Denk-Token…
Domänenspezifisch
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
5.3Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 2Antwortzeit (Durchschnitt)60.78sAntwortzeit (Maximum)120.94sAntwortzeit (Gesamt)182.34sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
7.2Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
44.4%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 2Antwortzeit (Durchschnitt)31.59sAntwortzeit (Maximum)85.12sAntwortzeit (Gesamt)94.77sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
31.59sAntwortzeit (Durchschnitt)…
804Gesamte Eingabe-Token…
69Ausgabe-Token…
18,378Denk-Token…
Allgemeine Intelligenz
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
5.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 1Antwortzeit (Durchschnitt)5.37sAntwortzeit (Maximum)5.37sAntwortzeit (Gesamt)5.37sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)4.65sAntwortzeit (Maximum)4.65sAntwortzeit (Gesamt)4.65sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
4.65sAntwortzeit (Durchschnitt)…
501Gesamte Eingabe-Token…
170Ausgabe-Token…
699Denk-Token…
Befolgung von Anweisungen
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)2.43sAntwortzeit (Maximum)2.87sAntwortzeit (Gesamt)4.86sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)6.17sAntwortzeit (Maximum)7.52sAntwortzeit (Gesamt)12.34sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
6.17sAntwortzeit (Durchschnitt)…
708Gesamte Eingabe-Token…
93Ausgabe-Token…
1,886Denk-Token…
Rätsellösen
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
7.7Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)4.91sAntwortzeit (Maximum)8.81sAntwortzeit (Gesamt)14.74sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)5.18sAntwortzeit (Maximum)8.14sAntwortzeit (Gesamt)15.53sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
5.18sAntwortzeit (Durchschnitt)…
714Gesamte Eingabe-Token…
370Ausgabe-Token…
2,310Denk-Token…
Werkzeugaufrufe
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
3.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)8.42sAntwortzeit (Maximum)8.42sAntwortzeit (Gesamt)8.42sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Ungültiger Werkzeugaufruf: 1Antwortzeit (Durchschnitt)4.48sAntwortzeit (Maximum)4.48sAntwortzeit (Gesamt)4.48sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
4.48sAntwortzeit (Durchschnitt)…
7,487Gesamte Eingabe-Token…
296Ausgabe-Token…
298Denk-Token…
Allgemeinwissen
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Eingabe-Token
Ausgabe-Token
Denk-Token
Qwen3.8 27BDie Antworten des Kandidaten wurden auf lokaler Hardware erzeugt. OpenRouter wurde nur zur Bewertung verwendet.
3.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine Antwort: 1Antwortzeit (Durchschnitt)12.64sAntwortzeit (Maximum)12.64sAntwortzeit (Gesamt)12.64sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
1.6Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)21.69sAntwortzeit (Maximum)21.69sAntwortzeit (Gesamt)21.69sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…