AI BENCHY
Your ad here

AI BENCHY زمرہ ناکامیاں

پہیلی حل کرنا: ہدایات پر عمل نہیں کیا

پہیلی حل کرنا
ہدایات پر عمل نہیں کیا

دیکھیں کہ پہیلی حل کرنا میں کن AI ماڈلز کو ہدایات پر عمل نہیں کیا پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔

دکھائے گئے ماڈلز

15

کل ناکامیاں

75

سب سے زیادہ متاثر ماڈل

GLM 5 Turbo 2
درجہ ماڈل کمپنی ہدایات پر عمل نہیں کیا کی تعداد زمرہ اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#45 GPT-5 Mini medium OpenAI 1 5.6 1/3 14.1s
#46 Kimi K2.5 medium Moonshot AI 1 5.3 1/3 45.4s
#48 Gemma 4 31B none Google 1 5.5 1/3 2.95s
#50 Hunter Alpha medium OpenRouter 1 6.1 1/3 5.36s
#52 Grok 4.1 Fast medium X AI 1 5.3 1/3 8.08s
#55 MiMo-V2-Omni none Xiaomi 1 8.0 2/3 2.71s
#57 GPT-5 Nano medium OpenAI 1 5.3 1/3 19.8s
#58 GLM 5V Turbo none Z.ai 1 5.3 1/3 2.22s
#59 Qwen3.5-Flash none Qwen 1 3.3 0/3 5.90s
#60 Gemma 4 26B A4B none Google 1 5.7 1/3 739ms
#62 Gemini 2.5 Flash none Google 1 5.7 1/3 576ms
#63 Qwen3.5-35B-A3B none Qwen 1 3.9 0/3 1.34s
#65 MiMo-V2-Pro none Xiaomi 1 6.0 1/3 1.83s
#66 GPT-5.4 none OpenAI 1 5.6 1/3 1.52s
#67 Qwen3.5-27B none Qwen 1 6.7 1/3 1.37s

ہدایات پر عمل نہیں کیا کی تعداد کے لحاظ سے سرفہرست ماڈلز

ہدایات پر عمل نہیں کیا کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز