AI BENCHY
Your ad here

AI BENCHY زمرہ ناکامیاں

عمومی ذہانت: ہدایات پر عمل نہیں کیا

عمومی ذہانت
ہدایات پر عمل نہیں کیا

دیکھیں کہ عمومی ذہانت میں کن AI ماڈلز کو ہدایات پر عمل نہیں کیا پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: ردِعمل کا وقت (اوسط) ↑.

دکھائے گئے ماڈلز

15

کل ناکامیاں

58

سب سے زیادہ متاثر ماڈل

LFM2-24B-A2B 1
درجہ ماڈل کمپنی ہدایات پر عمل نہیں کیا کی تعداد زمرہ اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#98 LFM2-24B-A2B none Liquid 1 4.0 0/1 395ms
#79 Grok 4.20 Beta none X AI 1 5.0 0/1 541ms
#90 Qwen3.5-9B none Qwen 1 4.4 0/1 552ms
#91 Mercury 2 none Inception 1 4.8 0/1 628ms
#29 Gemini 3.1 Flash Lite Preview none Google 1 4.0 0/1 741ms
#54 Mercury 2 medium Inception 1 4.8 0/1 821ms
#85 Elephant none Openrouter 1 4.0 0/1 854ms
#81 Elephant medium Openrouter 1 4.3 0/1 920ms
#95 Grok 4.1 Fast none X AI 1 4.4 0/1 1.08s
#70 Qwen3.5-122B-A10B none Qwen 1 5.0 0/1 1.12s
#55 MiMo-V2-Omni none Xiaomi 1 4.5 0/1 1.19s
#63 Qwen3.5-35B-A3B none Qwen 1 6.5 0/1 1.19s
#96 GPT-5.4 Nano none OpenAI 1 3.8 0/1 1.31s
#92 Qwen3 Coder Next medium Qwen 1 6.3 0/1 1.39s
#22 Gemini 3.1 Flash Lite Preview low Google 1 4.0 0/1 1.54s

ہدایات پر عمل نہیں کیا کی تعداد کے لحاظ سے سرفہرست ماڈلز

ہدایات پر عمل نہیں کیا کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز