AI BENCHY
Your ad here

AI BENCHY Fouten

Verkeerd antwoord-fouten

Zie welke AI-modellen het vaakst tegen Verkeerd antwoord aanlopen, zodat je betrouwbaarheidsrisico's ziet voordat je kiest. Sorteren op: Correcte tests โ†“.

Getoonde modellen

15

Totaal fouten

572

Meest getroffen model

Gemini 3.1 Pro Preview 1
Rang Model Bedrijf Verkeerd antwoord-aantal Score Correcte tests Responstijd (gem.)
#30 Step 3.5 Flash medium Stepfun 3 7.9 11/17 26.8s
#31 GLM 5V Turbo medium Z.ai 3 7.8 11/18 15.0s
#32 Qwen3.5-Flash medium Qwen 1 7.8 11/18 66.7s
#34 Kimi K2.6 medium Moonshot AI 2 7.7 11/18 45.2s
#35 MiMo-V2-Omni medium Xiaomi 3 7.7 11/18 16.8s
#36 GPT-5.3 Chat none OpenAI 5 7.7 11/18 5.88s
#38 GPT-5.4 Nano medium OpenAI 4 7.6 11/18 11.2s
#39 Seed-2.0-Mini medium Bytedance Seed 2 7.5 11/18 69.7s
#40 GPT-5.2 medium OpenAI 2 7.5 11/18 14.0s
#41 MiMo-V2-Flash medium Xiaomi 3 7.5 11/18 23.4s
#42 Claude Sonnet 4.6 none Anthropic 3 7.4 11/18 4.98s
#43 Qwen3.5-35B-A3B medium Qwen 2 7.4 10/18 44.5s
#48 Gemma 4 31B none Google 5 6.9 10/18 4.02s
#44 GPT-5.4 Mini medium OpenAI 4 7.3 9/18 15.2s
#45 GPT-5 Mini medium OpenAI 4 7.0 9/18 24.0s

Topmodellen op Verkeerd antwoord-aantal

Verkeerd antwoord-aantal vs Score

Topmodellen op Responstijd (gem.)