AI BENCHY
Your ad here

Kushindwa kwa kategoria za AI BENCHY

Utatuzi wa mafumbo: Hakufuata maelekezo

Utatuzi wa mafumbo
Hakufuata maelekezo

Ona ni modeli gani za AI zina uwezekano mkubwa wa kupata Hakufuata maelekezo katika Utatuzi wa mafumbo, ili uone udhaifu haraka.

Modeli zilizoonyeshwa

12

Jumla ya kushindwa

75

Modeli iliyoathirika zaidi

GLM 5 Turbo 2
Nafasi Modeli Kampuni Idadi ya Hakufuata maelekezo Alama ya kategoria Majaribio sahihi Muda wa majibu (wastani)
#72 Hunter Alpha none OpenRouter 1 5.8 1/3 3.06s
#75 GLM 5.1 none Z.ai 1 5.7 1/3 1.48s
#77 GLM 5 Turbo none Z.ai 1 5.5 1/3 2.43s
#79 Grok 4.20 Beta none X AI 1 5.9 1/3 541ms
#82 Grok 4.20 none X AI 1 5.3 1/3 487ms
#85 Elephant none Openrouter 1 3.3 0/3 849ms
#86 GPT-5.4 Mini none OpenAI 1 5.4 1/3 860ms
#88 Nemotron 3 Super none NVIDIA 1 5.7 1/3 7.50s
#93 GLM 4.7 Flash medium Z.ai 1 2.9 0/3 12.9s
#96 GPT-5.4 Nano none OpenAI 1 3.7 0/3 1.29s
#97 Qwen3.5-9B medium Qwen 1 3.1 0/3 33.4s
#98 LFM2-24B-A2B none Liquid 1 4.4 0/3 1.69s

Modeli bora kwa Idadi ya Hakufuata maelekezo

Idadi ya Hakufuata maelekezo dhidi ya Alama

Modeli bora kwa Muda wa majibu (wastani)

Modeli bora kwa Gharama iliyopotezwa inayokadiriwa