Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 8Anweisungen nicht befolgt: 1Antwortzeit (Durchschnitt)1.46sAntwortzeit (Maximum)2.89sAntwortzeit (Gesamt)21.86sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Zeitüberschreitung: 3Falsche Antwort: 2API-Fehler: 1Keine Antwort: 1Antwortzeit (Durchschnitt)44.84sAntwortzeit (Maximum)106.00sAntwortzeit (Gesamt)672.55sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
Konsistenz
8.9Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
6.7Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
Kosten pro Ergebnis
1.496Zeigt die durchschnittlichen Kosten pro korrekter Benchmark-Antwort in Cent an (niedriger ist besser).…
4.189Zeigt die durchschnittlichen Kosten pro korrekter Benchmark-Antwort in Cent an (niedriger ist besser).…
Gesamtkosten
$0.090Gesamtkosten…
$0.336Gesamtkosten…
Erfolgsquote pro Versuch
44.4%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
80.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
Instabile Tests
2Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
6Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
common.totalRuns
45 (15 x 3)common.totalRuns…
45 (15 x 3)common.totalRuns…
Ausgabe-Token
1,635Ausgabe-Token…
5,475Ausgabe-Token…
Denk-Token
0Denk-Token…
165,513Denk-Token…
Antwortzeit (Durchschnitt)
1.46sAntwortzeit (Durchschnitt)…
44.84sAntwortzeit (Durchschnitt)…
Antwortzeit (Maximum)
2.89sAntwortzeit (Maximum)…
106.00sAntwortzeit (Maximum)…
Antwortzeit (Gesamt)
21.86sAntwortzeit (Gesamt)…
672.55sAntwortzeit (Gesamt)…
Top-Modelle nach Score
Score vs. Gesamtkosten
Antwortzeit (Durchschnitt)
Ø-Score vs Antwortzeit (Durchschnitt)
Kategorieaufschlüsselung
Anti-KI-Tricks
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Ausgabe-Token
Denk-Token
OpenAI: GPT-5.4
10.0Durchschnittswert über alle Benchmark-Tests.…
7.3Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
11.1%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 3Antwortzeit (Durchschnitt)1.41sAntwortzeit (Maximum)2.58sAntwortzeit (Gesamt)4.23sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
1.41sAntwortzeit (Durchschnitt)…
388Ausgabe-Token…
0Denk-Token…
Qwen: Qwen3.5-35B-A3B
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)21.75sAntwortzeit (Maximum)34.96sAntwortzeit (Gesamt)65.26sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
21.75sAntwortzeit (Durchschnitt)…
429Ausgabe-Token…
36,235Denk-Token…
Kombiniert
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Ausgabe-Token
Denk-Token
OpenAI: GPT-5.4
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)2.89sAntwortzeit (Maximum)2.89sAntwortzeit (Gesamt)2.89sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
2.89sAntwortzeit (Durchschnitt)…
291Ausgabe-Token…
0Denk-Token…
Qwen: Qwen3.5-35B-A3B
10.0Durchschnittswert über alle Benchmark-Tests.…
1.6Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine Antwort: 1Antwortzeit (Durchschnitt)75.34sAntwortzeit (Maximum)75.34sAntwortzeit (Gesamt)75.34sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
75.34sAntwortzeit (Durchschnitt)…
775Ausgabe-Token…
12,485Denk-Token…
Datenanalyse und -extraktion
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Ausgabe-Token
Denk-Token
OpenAI: GPT-5.4
9.9Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)1.04sAntwortzeit (Maximum)1.06sAntwortzeit (Gesamt)2.08sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
1.04sAntwortzeit (Durchschnitt)…
222Ausgabe-Token…
0Denk-Token…
Qwen: Qwen3.5-35B-A3B
5.5Durchschnittswert über alle Benchmark-Tests.…
5.9Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
83.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.API-Fehler: 1Antwortzeit (Durchschnitt)59.33sAntwortzeit (Maximum)97.12sAntwortzeit (Gesamt)118.65sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
59.33sAntwortzeit (Durchschnitt)…
235Ausgabe-Token…
19,493Denk-Token…
Domänenspezifisch
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Ausgabe-Token
Denk-Token
OpenAI: GPT-5.4
4.0Durchschnittswert über alle Benchmark-Tests.…
7.2Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
44.4%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 2Antwortzeit (Durchschnitt)1.07sAntwortzeit (Maximum)1.54sAntwortzeit (Gesamt)3.22sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
1.07sAntwortzeit (Durchschnitt)…
50Ausgabe-Token…
0Denk-Token…
Qwen: Qwen3.5-35B-A3B
10.0Durchschnittswert über alle Benchmark-Tests.…
4.4Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
44.5%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
2Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Zeitüberschreitung: 2Falsche Antwort: 1Antwortzeit (Durchschnitt)88.34sAntwortzeit (Maximum)106.00sAntwortzeit (Gesamt)265.01sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
88.34sAntwortzeit (Durchschnitt)…
41Ausgabe-Token…
46,368Denk-Token…
Befolgung von Anweisungen
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Ausgabe-Token
Denk-Token
OpenAI: GPT-5.4
5.5Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
50.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)1.07sAntwortzeit (Maximum)1.17sAntwortzeit (Gesamt)2.15sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
1.07sAntwortzeit (Durchschnitt)…
81Ausgabe-Token…
0Denk-Token…
Qwen: Qwen3.5-35B-A3B
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)24.45sAntwortzeit (Maximum)43.36sAntwortzeit (Gesamt)48.89sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
24.45sAntwortzeit (Durchschnitt)…
97Ausgabe-Token…
17,361Denk-Token…
Puzzle Solving
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Ausgabe-Token
Denk-Token
OpenAI: GPT-5.4
4.0Durchschnittswert über alle Benchmark-Tests.…
9.8Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 1Falsche Antwort: 1Antwortzeit (Durchschnitt)1.52sAntwortzeit (Maximum)1.82sAntwortzeit (Gesamt)4.56sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
1.52sAntwortzeit (Durchschnitt)…
357Ausgabe-Token…
0Denk-Token…
Qwen: Qwen3.5-35B-A3B
4.0Durchschnittswert über alle Benchmark-Tests.…
4.4Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
77.8%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
2Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Zeitüberschreitung: 1Falsche Antwort: 1Antwortzeit (Durchschnitt)31.58sAntwortzeit (Maximum)60.18sAntwortzeit (Gesamt)94.75sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
31.58sAntwortzeit (Durchschnitt)…
3,589Ausgabe-Token…
32,206Denk-Token…
Werkzeugaufrufe
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Ausgabe-Token
Denk-Token
OpenAI: GPT-5.4
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)2.75sAntwortzeit (Maximum)2.75sAntwortzeit (Gesamt)2.75sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
2.75sAntwortzeit (Durchschnitt)…
246Ausgabe-Token…
0Denk-Token…
Qwen: Qwen3.5-35B-A3B
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)4.65sAntwortzeit (Maximum)4.65sAntwortzeit (Gesamt)4.65sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…