9.6Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
8.5Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
Kosten pro Ergebnis
2.504Zeigt die durchschnittlichen Kosten pro korrekter Benchmark-Antwort in Cent an (niedriger ist besser).…
6.601Zeigt die durchschnittlichen Kosten pro korrekter Benchmark-Antwort in Cent an (niedriger ist besser).…
Gesamtkosten
$0.251Gesamtkosten…
$0.793Gesamtkosten…
Korrekte Tests
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Zusätzliche Formatierung: 3Falsche Antwort: 2Anweisungen nicht befolgt: 1Antwortzeit (Durchschnitt)5.57sAntwortzeit (Maximum)23.84sAntwortzeit (Gesamt)50.12sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 2Falsche Antwort: 2Antwortzeit (Durchschnitt)20.05sAntwortzeit (Maximum)100.41sAntwortzeit (Gesamt)320.87sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
Erfolgsquote pro Versuch
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
83.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
Instabile Tests
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
3Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Gesamtläufe
48 (16 x 3)Gesamtläufe…
48 (16 x 3)Gesamtläufe…
Ausgabe-Token
6,895Ausgabe-Token…
1,756Ausgabe-Token…
Denk-Token
0Denk-Token…
46,642Denk-Token…
Antwortzeit (Durchschnitt)
5.57sAntwortzeit (Durchschnitt)…
20.05sAntwortzeit (Durchschnitt)…
Antwortzeit (Maximum)
23.84sAntwortzeit (Maximum)…
100.41sAntwortzeit (Maximum)…
Antwortzeit (Gesamt)
50.12sAntwortzeit (Gesamt)…
320.87sAntwortzeit (Gesamt)…
Top-Modelle nach Score
Score vs. Gesamtkosten
Antwortzeit (Durchschnitt)
Ø-Score vs Antwortzeit (Durchschnitt)
Kategorieaufschlüsselung
Anti-KI-Tricks
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Ausgabe-Token
Denk-Token
Anthropic: Claude Sonnet 4.6
4.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Zusätzliche Formatierung: 2Antwortzeit (Durchschnitt)4.83sAntwortzeit (Maximum)4.83sAntwortzeit (Gesamt)4.83sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
4.83sAntwortzeit (Durchschnitt)…
1,199Ausgabe-Token…
0Denk-Token…
OpenAI: GPT-5.4
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)5.02sAntwortzeit (Maximum)6.42sAntwortzeit (Gesamt)15.06sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
5.02sAntwortzeit (Durchschnitt)…
216Ausgabe-Token…
1,466Denk-Token…
Kombiniert
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Ausgabe-Token
Denk-Token
Anthropic: Claude Sonnet 4.6
9.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)23.84sAntwortzeit (Maximum)23.84sAntwortzeit (Gesamt)23.84sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
23.84sAntwortzeit (Durchschnitt)…
3,766Ausgabe-Token…
0Denk-Token…
OpenAI: GPT-5.4
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)20.57sAntwortzeit (Maximum)20.57sAntwortzeit (Gesamt)20.57sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
20.57sAntwortzeit (Durchschnitt)…
301Ausgabe-Token…
3,543Denk-Token…
Datenanalyse und -extraktion
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Ausgabe-Token
Denk-Token
Anthropic: Claude Sonnet 4.6
9.9Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)3.43sAntwortzeit (Maximum)3.43sAntwortzeit (Gesamt)3.43sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
3.43sAntwortzeit (Durchschnitt)…
252Ausgabe-Token…
0Denk-Token…
OpenAI: GPT-5.4
9.9Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)5.32sAntwortzeit (Maximum)5.40sAntwortzeit (Gesamt)10.64sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
5.32sAntwortzeit (Durchschnitt)…
234Ausgabe-Token…
804Denk-Token…
Domänenspezifisch
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Ausgabe-Token
Denk-Token
Anthropic: Claude Sonnet 4.6
7.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)3.54sAntwortzeit (Maximum)3.54sAntwortzeit (Gesamt)3.54sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
3.54sAntwortzeit (Durchschnitt)…
413Ausgabe-Token…
0Denk-Token…
OpenAI: GPT-5.4
4.0Durchschnittswert über alle Benchmark-Tests.…
7.2Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
44.4%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 2Antwortzeit (Durchschnitt)74.27sAntwortzeit (Maximum)100.41sAntwortzeit (Gesamt)222.80sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
74.27sAntwortzeit (Durchschnitt)…
61Ausgabe-Token…
34,748Denk-Token…
Allgemeine Intelligenz
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Ausgabe-Token
Denk-Token
Anthropic: Claude Sonnet 4.6
5.0Durchschnittswert über alle Benchmark-Tests.…
3.1Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 1Antwortzeit (Durchschnitt)2.56sAntwortzeit (Maximum)2.56sAntwortzeit (Gesamt)2.56sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
2.56sAntwortzeit (Durchschnitt)…
192Ausgabe-Token…
0Denk-Token…
OpenAI: GPT-5.4
5.0Durchschnittswert über alle Benchmark-Tests.…
3.1Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 1Antwortzeit (Durchschnitt)4.92sAntwortzeit (Maximum)4.92sAntwortzeit (Gesamt)4.92sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
4.92sAntwortzeit (Durchschnitt)…
145Ausgabe-Token…
321Denk-Token…
Befolgung von Anweisungen
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Ausgabe-Token
Denk-Token
Anthropic: Claude Sonnet 4.6
5.5Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
50.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)1.96sAntwortzeit (Maximum)1.96sAntwortzeit (Gesamt)1.96sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
1.96sAntwortzeit (Durchschnitt)…
90Ausgabe-Token…
0Denk-Token…
OpenAI: GPT-5.4
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)3.11sAntwortzeit (Maximum)3.68sAntwortzeit (Gesamt)6.22sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
3.11sAntwortzeit (Durchschnitt)…
93Ausgabe-Token…
897Denk-Token…
Puzzle Solving
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Ausgabe-Token
Denk-Token
Anthropic: Claude Sonnet 4.6
7.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
66.7%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Zusätzliche Formatierung: 1Antwortzeit (Durchschnitt)2.92sAntwortzeit (Maximum)3.33sAntwortzeit (Gesamt)5.84sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
2.92sAntwortzeit (Durchschnitt)…
536Ausgabe-Token…
0Denk-Token…
OpenAI: GPT-5.4
7.0Durchschnittswert über alle Benchmark-Tests.…
7.2Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
88.9%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Anweisungen nicht befolgt: 1Antwortzeit (Durchschnitt)9.13sAntwortzeit (Maximum)18.14sAntwortzeit (Gesamt)27.39sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
9.13sAntwortzeit (Durchschnitt)…
442Ausgabe-Token…
3,832Denk-Token…
Werkzeugaufrufe
Punktzahl
Konsistenz
Erfolgsquote pro Versuch
Instabile Tests
Korrekte Tests
Antwortzeit (Durchschnitt)
Ausgabe-Token
Denk-Token
Anthropic: Claude Sonnet 4.6
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)4.11sAntwortzeit (Maximum)4.11sAntwortzeit (Gesamt)4.11sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
4.11sAntwortzeit (Durchschnitt)…
447Ausgabe-Token…
0Denk-Token…
OpenAI: GPT-5.4
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)13.28sAntwortzeit (Maximum)13.28sAntwortzeit (Gesamt)13.28sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…