AI BENCHY
Advertise here

AI BENCHY زمرہ ناکامیاں

پہیلی حل کرنا: ہدایات پر عمل نہیں کیا

پہیلی حل کرنا
ہدایات پر عمل نہیں کیا

دیکھیں کہ پہیلی حل کرنا میں کن AI ماڈلز کو ہدایات پر عمل نہیں کیا پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: ردِعمل کا وقت (اوسط) ↑.

دکھائے گئے ماڈلز

15

کل ناکامیاں

78

سب سے زیادہ متاثر ماڈل

Mistral Small 4 1
درجہ ماڈل کمپنی ہدایات پر عمل نہیں کیا کی تعداد زمرہ اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#142 Mistral Small 4 none Mistral 1 3.1 0/3 399ms
#162 Nemotron 3 Nano Omni 30b A3b Reasoning none NVIDIA 1 3.0 0/3 532ms
#163 Granite 4.1 8B none IBM Granite 1 3.2 0/3 608ms
#154 Qwen3.5-9B none Qwen 1 3.2 0/3 621ms
#90 Gemini 3.1 Flash Lite none Google 1 6.3 1/3 720ms
#102 Gemma 4 26B A4B none Google 1 6.2 1/3 744ms
#137 Elephant Alpha none Openrouter 1 4.2 0/3 807ms
#144 GPT-5.4 Mini none OpenAI 1 5.4 1/3 836ms
#136 Elephant Alpha medium Openrouter 1 5.3 1/3 868ms
#81 Mercury 2 medium Inception 1 5.4 1/3 949ms
#131 Qwen3.5-122B-A10B none Qwen 1 3.8 0/3 1.00s
#104 Nemotron 3 Ultra 550b A55b none NVIDIA 1 5.9 1/3 1.06s
#153 Qwen3.6 35B A3B none Qwen 2 3.2 0/3 1.07s
#122 GLM 4.7 Flash none Z.ai 1 6.4 1/3 1.20s
#147 GPT-4o-mini none OpenAI 1 3.5 0/3 1.21s

ہدایات پر عمل نہیں کیا کی تعداد کے لحاظ سے سرفہرست ماڈلز

ہدایات پر عمل نہیں کیا کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز