AI BENCHY
Your ad here

Eșecuri pe categorii AI BENCHY

Respectarea instrucțiunilor: Răspuns greșit

Respectarea instrucțiunilor
Răspuns greșit

Vezi ce modele AI au cele mai mari șanse să întâmpine Răspuns greșit la Respectarea instrucțiunilor, ca să găsești mai repede punctele slabe.

Modele afișate

15

Eșecuri totale

44

Modelul cel mai afectat

Qwen3.5-27B 2
Rang Model Companie Număr de Răspuns greșit Scor de categorie Teste corecte Timp de răspuns (mediu)
#67 Qwen3.5-27B none Qwen 2 4.8 0/2 815ms
#70 Qwen3.5-122B-A10B none Qwen 2 4.5 0/2 585ms
#87 Qwen3 Coder Next none Qwen 2 4.8 0/2 7.71s
#95 Grok 4.1 Fast none X AI 2 3.0 0/2 923ms
#98 LFM2-24B-A2B none Liquid 2 4.8 0/2 1.09s
#21 Gemini 3 Flash Preview none Google 1 6.4 1/2 1.58s
#28 GPT-5.2 Chat none OpenAI 1 7.5 1/2 5.46s
#33 GLM 5.1 medium Z.ai 1 6.4 1/2 7.47s
#36 GPT-5.3 Chat none OpenAI 1 8.3 1/2 3.29s
#42 Claude Sonnet 4.6 none Anthropic 1 6.5 1/2 1.96s
#48 Gemma 4 31B none Google 1 6.5 1/2 2.84s
#55 MiMo-V2-Omni none Xiaomi 1 6.5 1/2 4.18s
#58 GLM 5V Turbo none Z.ai 1 6.5 1/2 1.97s
#59 Qwen3.5-Flash none Qwen 1 6.3 1/2 8.81s
#60 Gemma 4 26B A4B none Google 1 4.4 0/2 1.08s

Top modele după Număr de Răspuns greșit

Număr de Răspuns greșit vs Scor

Top modele după Timp de răspuns (mediu)

Top modele după Cost irosit estimat