AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Fehler

Falsche Antwort-Fehler

Sieh, bei welchen KI-Modellen Falsche Antwort besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Antwortzeit (Durchschnitt) ↑.

Angezeigte Modelle

7

Gesamtfehler

572

Am stärksten betroffenes Modell

Mercury 2 13
Rang Modell Unternehmen Falsche Antwort-Anzahl Punktzahl Korrekte Tests Antwortzeit (Durchschnitt)
#8 Qwen3.5 Plus 2026-02-15 medium Qwen 2 8.5 14/18 46.6s
#10 Qwen3.5-27B medium Qwen 1 8.4 13/18 53.0s
#32 Qwen3.5-Flash medium Qwen 1 7.8 11/18 66.7s
#11 Gemini 3.1 Flash Lite Preview high Google 3 8.4 12/16 68.8s
#39 Seed-2.0-Mini medium Bytedance Seed 2 7.5 11/18 69.7s
#46 Kimi K2.5 medium Moonshot AI 4 7.0 9/18 72.4s
#97 Qwen3.5-9B medium Qwen 1 4.4 3/18 73.6s

Top-Modelle nach Falsche Antwort-Anzahl

Falsche Antwort-Anzahl vs Punktzahl

Top-Modelle nach Antwortzeit (Durchschnitt)