AI BENCHY
Advertise here

AI BENCHY Fouten

Instructies niet gevolgd-fouten

Zie welke AI-modellen het vaakst tegen Instructies niet gevolgd aanlopen, zodat je betrouwbaarheidsrisico's ziet voordat je kiest.

Getoonde modellen

15

Totaal fouten

215

Meest getroffen model

MiniMax M2.7 5
Rang Model Bedrijf Instructies niet gevolgd-aantal Score Correcte tests Responstijd (gem.)
#58 Gemini 3.1 Flash Lite Preview none Google 2 7.2 12/21 1.21s
#60 Kimi K2.6 medium Moonshot AI 2 7.2 12/21 71.7s
#63 GPT-5.3 Chat none OpenAI 2 7.2 12/21 6.34s
#65 Grok 4.20 medium X AI 2 7.1 12/21 27.7s
#67 MiniMax M3 medium Minimax 2 7.1 11/21 68.2s
#70 GPT-5.4 Nano medium OpenAI 2 7.0 11/21 12.0s
#75 Ring-2.6-1T medium Inclusionai 2 6.9 11/21 61.3s
#76 Kimi K2.5 medium Moonshot AI 2 6.8 10/21 98.4s
#79 Hunter Alpha medium OpenRouter 2 6.7 8/18 10.3s
#80 Mimo V2 Omni medium Xiaomi 2 6.7 10/21 41.2s
#84 Grok 4.20 Multi Agent Beta medium X AI 2 6.6 8/18 9.69s
#94 GPT-5 Nano medium OpenAI 2 6.3 9/21 42.5s
#96 Ring-2.6-1T none Inclusionai 2 6.2 9/21 55.1s
#100 Grok Build 0.1 none X AI 2 6.0 7/19 28.7s
#102 Gemma 4 26B A4B none Google 2 6.0 8/21 5.91s

Topmodellen op Instructies niet gevolgd-aantal

Instructies niet gevolgd-aantal vs Score

Topmodellen op Responstijd (gem.)