AI BENCHY
Your ad here

AI BENCHY Fehler

Falsche Antwort-Fehler

Sieh, bei welchen KI-Modellen Falsche Antwort besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst.

Angezeigte Modelle

15

Gesamtfehler

572

Am stärksten betroffenes Modell

GPT-4o-mini 13
Rang Modell Unternehmen Falsche Antwort-Anzahl Punktzahl Korrekte Tests Antwortzeit (Durchschnitt)
#75 GLM 5.1 none Z.ai 10 5.6 5/18 4.33s
#77 GLM 5 Turbo none Z.ai 10 5.5 6/18 2.94s
#79 Grok 4.20 Beta none X AI 10 5.3 4/18 1.19s
#86 GPT-5.4 Mini none OpenAI 10 5.1 5/18 1.17s
#88 Nemotron 3 Super none NVIDIA 10 5.1 4/18 8.54s
#90 Qwen3.5-9B none Qwen 10 4.8 4/18 1.47s
#49 Qwen3.5 Plus 2026-02-15 none Qwen 9 6.8 9/18 2.60s
#53 GLM 5 none Z.ai 9 6.6 9/18 4.23s
#59 Qwen3.5-Flash none Qwen 9 6.2 8/18 3.25s
#63 Qwen3.5-35B-A3B none Qwen 9 6.1 7/18 3.82s
#65 MiMo-V2-Pro none Xiaomi 9 6.0 7/18 2.39s
#72 Hunter Alpha none OpenRouter 9 5.7 6/18 4.58s
#81 Elephant medium Openrouter 9 5.2 5/18 1.27s
#82 Grok 4.20 none X AI 9 5.2 5/18 1.11s
#85 Elephant none Openrouter 9 5.2 5/18 1.23s

Top-Modelle nach Falsche Antwort-Anzahl

Falsche Antwort-Anzahl vs Punktzahl

Top-Modelle nach Antwortzeit (Durchschnitt)