AI BENCHY
Advertise here

AI BENCHY زمرہ ناکامیاں

پہیلی حل کرنا: ہدایات پر عمل نہیں کیا

پہیلی حل کرنا
ہدایات پر عمل نہیں کیا

دیکھیں کہ پہیلی حل کرنا میں کن AI ماڈلز کو ہدایات پر عمل نہیں کیا پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔

دکھائے گئے ماڈلز

15

کل ناکامیاں

78

سب سے زیادہ متاثر ماڈل

Gemini 3.1 Flash Lite 2
درجہ ماڈل کمپنی ہدایات پر عمل نہیں کیا کی تعداد زمرہ اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#90 Gemini 3.1 Flash Lite none Google 1 6.3 1/3 720ms
#94 GPT-5 Nano medium OpenAI 1 5.3 1/3 20.6s
#96 Ring-2.6-1T none Inclusionai 1 7.7 2/3 31.5s
#99 gpt-oss-120b medium OpenAI 1 5.3 1/3 21.7s
#100 Grok Build 0.1 none X AI 1 6.4 1/3 9.55s
#102 Gemma 4 26B A4B none Google 1 6.2 1/3 744ms
#104 Nemotron 3 Ultra 550b A55b none NVIDIA 1 5.9 1/3 1.06s
#105 Nemotron 3 Super medium NVIDIA 1 3.0 0/3 3.15s
#109 GLM 5V Turbo none Z.ai 1 5.3 1/3 2.40s
#111 Owl Alpha medium Openrouter 1 5.3 1/3 3.40s
#115 Qwen3.5-27B none Qwen 1 6.7 1/3 1.38s
#116 Hunter Alpha none OpenRouter 1 5.8 1/3 3.71s
#117 Qwen3.5-35B-A3B none Qwen 1 3.7 0/3 1.35s
#118 Qwen3.6 27B none Qwen 1 5.3 1/3 5.15s
#119 Cobuddy medium Baidu 1 3.6 0/3 12.8s

ہدایات پر عمل نہیں کیا کی تعداد کے لحاظ سے سرفہرست ماڈلز

ہدایات پر عمل نہیں کیا کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز