AI BENCHY
Your ad here

AI BENCHY زمرہ ناکامیاں

ہدایات کی پیروی: ہدایات پر عمل نہیں کیا

ہدایات کی پیروی
ہدایات پر عمل نہیں کیا

دیکھیں کہ ہدایات کی پیروی میں کن AI ماڈلز کو ہدایات پر عمل نہیں کیا پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: درست ٹیسٹس ↑.

دکھائے گئے ماڈلز

15

کل ناکامیاں

22

سب سے زیادہ متاثر ماڈل

Gemma 4 26B A4B 1
درجہ ماڈل کمپنی ہدایات پر عمل نہیں کیا کی تعداد زمرہ اسکور درست ٹیسٹس ردِعمل کا وقت (اوسط)
#60 Gemma 4 26B A4B none Google 1 4.4 0/2 1.08s
#78 Trinity Large Preview none Arcee AI 1 4.1 0/2 1.09s
#79 Grok 4.20 Beta none X AI 1 4.8 0/2 687ms
#80 MiniMax M2.7 medium Minimax 1 3.7 0/2 12.6s
#82 Grok 4.20 none X AI 1 4.8 0/2 455ms
#88 Nemotron 3 Super none NVIDIA 1 4.9 0/2 1.50s
#89 GPT-4o-mini none OpenAI 1 4.8 0/2 1.27s
#92 Qwen3 Coder Next medium Qwen 1 4.8 0/2 7.34s
#96 GPT-5.4 Nano none OpenAI 1 5.0 0/2 787ms
#11 Gemini 3.1 Flash Lite Preview high Google 1 7.9 1/2 70.1s
#25 Grok 4.20 Beta medium X AI 1 8.3 1/2 4.97s
#30 Step 3.5 Flash medium Stepfun 1 8.5 1/2 4.98s
#35 MiMo-V2-Omni medium Xiaomi 1 8.3 1/2 4.92s
#44 GPT-5.4 Mini medium OpenAI 1 7.4 1/2 2.50s
#45 GPT-5 Mini medium OpenAI 1 8.0 1/2 15.7s

ہدایات پر عمل نہیں کیا کی تعداد کے لحاظ سے سرفہرست ماڈلز

ہدایات پر عمل نہیں کیا کی تعداد بمقابلہ اسکور

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز

تخمینی ضائع لاگت کے لحاظ سے سرفہرست ماڈلز