AI BENCHY
Vergleichen Diagramme
❤️ Made by XCS
Your ad here

#7

GPT-5.4

OpenAI · Veröffentlichung: 2026-03-05 · openai/gpt-5.4::medium

Ø-Score

8.2

Kosten pro Ergebnis

6.533

Konsistenz

8.9

Gesamtkosten

$0.784

Korrekte Tests

12

Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.

Falsche Tests

3

Erfolgsquote pro Versuch: 86.7%

Instabile Tests

2

Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).

Antwortzeit (Durchschnitt)

21.06s

Antwortzeit (Maximum): 100.41s

Antwortzeit (Gesamt): 315.95s

Falsche Antwort: 2 Anweisungen nicht befolgt: 1

Top-Modelle nach Score

Wähle zuerst das erste Modell und klicke dann ein zweites Modell, um eine Seite im direkten Vergleich zu öffnen.

Schnellvergleich

Kategorieaufschlüsselung

Kategorie Ø-Score Konsistenz Korrekte Tests
Anti-AI Tricks 10.0 10.0 3/3
Combined 10.0 10.0 1/1
Data parsing and extraction 9.9 10.0 2/2
Domain specific 4.0 7.2 1/3
Instructions following 10.0 10.0 2/2
Puzzle Solving 7.0 7.2 2/3
Tool Calling 10.0 10.0 1/1