AI BENCHY
AD
Track all your projects in one dashboard. Get ๐Ÿ“Šstats, ๐Ÿ”ฅheatmaps and ๐Ÿ‘€recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Fouten

Extra opmaak-fouten

Zie welke AI-modellen het vaakst tegen Extra opmaak aanlopen, zodat je betrouwbaarheidsrisico's ziet voordat je kiest. Sorteren op: Aantal fouten โ†‘.

Getoonde modellen

15

Totaal fouten

48

Meest getroffen model

Qwen3.5-27B 1
Rang Model Bedrijf Extra opmaak-aantal Score Correcte tests Responstijd (gem.)
#30 Qwen3.5-27B medium Qwen 1 7.8 13/21 68.4s
#38 Grok 4.3 medium X AI 1 7.6 13/21 47.5s
#51 Mimo V2 PRO medium Xiaomi 1 7.4 12/21 22.2s
#55 GLM 5.1 medium Z.ai 1 7.3 12/21 33.7s
#64 MiMo-V2-Flash medium Xiaomi 1 7.2 12/21 20.1s
#65 Grok 4.20 medium X AI 1 7.1 12/21 27.7s
#67 MiniMax M3 medium Minimax 1 7.1 11/21 68.2s
#79 Hunter Alpha medium OpenRouter 1 6.7 8/18 10.3s
#80 Mimo V2 Omni medium Xiaomi 1 6.7 10/21 41.2s
#101 Mimo V2 Omni none Xiaomi 1 6.0 8/21 2.44s
#113 DeepSeek V4 Pro none DeepSeek 1 5.7 7/21 12.4s
#121 Owl Alpha none Openrouter 1 5.5 7/21 9.88s
#127 Grok 4.20 none X AI 1 5.4 6/18 1.11s
#140 Qwen3 Coder Next none Qwen 1 4.9 5/21 8.62s
#143 MiMo-V2.5 none Xiaomi 1 4.9 5/21 2.20s

Topmodellen op Extra opmaak-aantal

Extra opmaak-aantal vs Score

Topmodellen op Responstijd (gem.)