AI BENCHY
Advertise here

Eșecuri AI BENCHY

Eșecuri Nu a urmat instrucțiunile

Vezi ce modele AI se lovesc cel mai des de Nu a urmat instrucțiunile, ca să identifici riscurile de fiabilitate înainte să alegi.

Modele afișate

15

Eșecuri totale

215

Modelul cel mai afectat

MiniMax M2.7 5
Rang Model Companie Număr de Nu a urmat instrucțiunile Scor Teste corecte Timp de răspuns (mediu)
#130 MiniMax M2.7 medium Minimax 5 5.3 5/21 38.2s
#86 Grok 4.1 Fast medium X AI 4 6.5 9/19 23.8s
#123 MiMo-V2.5-Pro none Xiaomi 4 5.5 6/21 1.78s
#156 Hy3 preview none Tencent 4 4.4 4/21 12.9s
#163 Granite 4.1 8B none IBM Granite 4 4.0 2/21 728ms
#42 GPT-5.2 medium OpenAI 3 7.5 13/21 16.9s
#45 GPT-5.4 Mini medium OpenAI 3 7.5 12/21 22.3s
#53 Gemini 3.1 Flash Lite high Google 3 7.3 10/18 62.0s
#54 GPT-5 Mini medium OpenAI 3 7.3 12/21 23.6s
#62 Step 3.5 Flash medium Stepfun 3 7.2 11/20 72.5s
#81 Mercury 2 medium Inception 3 6.6 10/21 2.24s
#87 Gemini 3.1 Flash Lite minimal Google 3 6.4 10/21 1.33s
#99 gpt-oss-120b medium OpenAI 3 6.1 9/21 22.3s
#105 Nemotron 3 Super medium NVIDIA 3 5.8 8/21 32.0s
#119 Cobuddy medium Baidu 3 5.6 7/21 39.9s

Top modele după Număr de Nu a urmat instrucțiunile

Număr de Nu a urmat instrucțiunile vs Scor

Top modele după Timp de răspuns (mediu)